Pular para o conteúdo
GenAI BR
InterpretabilidadeNo acervo desde 06 de set. de 2026

Milhões de features interpretáveis extraídas de um modelo de produção — inclusive uma que faz o modelo achar que é a Golden Gate

Interpretabilidadeavançadotécnicopaper · Anthropic · 21 de mai. de 2024
Baixar cartão
O que é
A equipe de interpretabilidade da Anthropic treinou sparse autoencoders com 1, 4 e 34 milhões de features sobre as ativações do Claude 3 Sonnet, e mostrou que muitas correspondem a conceitos legíveis — lugares, pessoas, código inseguro, bajulação — e que ativá-las artificialmente muda o comportamento do modelo.
O que foi demonstrado
Features multilíngues e multimodais; features relevantes para segurança (engano, busca de poder, viés); a demonstração pública do “Golden Gate Claude”, em que uma única feature amplificada dominou as respostas.
O que ainda não foi
Publicado pelo próprio laboratório, sobre o próprio modelo, sem revisão externa. Sparse autoencoders capturam parte das ativações; o que fica de fora é uma questão aberta.
Por que importa
Foi o momento em que interpretabilidade mecanicista saiu de modelos de brinquedo para um modelo que as pessoas usam.
  1. GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio

    Produtotécnicotécnico, decisoranúncio · OpenAI · 03 de set. de 2026
  2. Grafos de atribuição mostram o modelo planejando rimas com antecedência — e cadeias de pensamento que não correspondem ao cálculo real

    Interpretabilidadeavançadotécnicopaper · Anthropic · 27 de mar. de 2025

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.