Pular para o conteúdo
GenAI BR
InterpretabilidadeNo acervo desde 06 de set. de 2026

Grafos de atribuição mostram o modelo planejando rimas com antecedência — e cadeias de pensamento que não correspondem ao cálculo real

Interpretabilidadeavançadotécnicopaper · Anthropic · 27 de mar. de 2025
Baixar cartão
O que é
“On the Biology of a Large Language Model”, com o companheiro metodológico “Circuit Tracing”, aplica grafos de atribuição ao Claude 3.5 Haiku para rastrear circuitos de cálculo em tarefas concretas: raciocínio multi-passo, planejamento de rimas em poesia, circuitos multilíngues compartilhados, aritmética.
O que foi demonstrado
Evidência de planejamento adiante (o modelo escolhe a palavra da rima antes de escrever o verso) e casos em que a explicação em cadeia de pensamento é infiel ao que o modelo de fato computou.
O que ainda não foi
Estudo de casos, não estatística; publicado pelo laboratório sobre o próprio modelo. Os autores listam limitações longas do método.
Por que importa
A infidelidade da cadeia de pensamento é a razão técnica pela qual “ler o raciocínio” não é garantia de segurança — o que o system card do GPT-6 Astra acabou de admitir na prática.
  1. GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio

    Produtotécnicotécnico, decisoranúncio · OpenAI · 03 de set. de 2026
  2. Milhões de features interpretáveis extraídas de um modelo de produção — inclusive uma que faz o modelo achar que é a Golden Gate

    Interpretabilidadeavançadotécnicopaper · Anthropic · 21 de mai. de 2024

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.