Grafos de atribuição mostram o modelo planejando rimas com antecedência — e cadeias de pensamento que não correspondem ao cálculo real
- O que é
- “On the Biology of a Large Language Model”, com o companheiro metodológico “Circuit Tracing”, aplica grafos de atribuição ao Claude 3.5 Haiku para rastrear circuitos de cálculo em tarefas concretas: raciocínio multi-passo, planejamento de rimas em poesia, circuitos multilíngues compartilhados, aritmética.
- O que foi demonstrado
- Evidência de planejamento adiante (o modelo escolhe a palavra da rima antes de escrever o verso) e casos em que a explicação em cadeia de pensamento é infiel ao que o modelo de fato computou.
- O que ainda não foi
- Estudo de casos, não estatística; publicado pelo laboratório sobre o próprio modelo. Os autores listam limitações longas do método.
- Por que importa
- A infidelidade da cadeia de pensamento é a razão técnica pela qual “ler o raciocínio” não é garantia de segurança — o que o system card do GPT-6 Astra acabou de admitir na prática.
No mesmo tema
Interpretabilidade→Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.