Pular para o conteúdo
GenAI BR
Acervo · Tema3 verbetes neste tema

Interpretabilidade

O que acontece dentro do modelo: features, circuitos, fidelidade da cadeia de pensamento.

  1. GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio

    Para quem constrói, redefine o ponto de preço/desempenho da fronteira; para quem governa, é o primeiro flagship cujo próprio relatório admite que ler o raciocínio está ficando menos confiável.

    Produtotécnicotécnico, decisoranúncio · OpenAI · 03 de set. de 2026
  2. Milhões de features interpretáveis extraídas de um modelo de produção — inclusive uma que faz o modelo achar que é a Golden Gate

    Foi o momento em que interpretabilidade mecanicista saiu de modelos de brinquedo para um modelo que as pessoas usam.

    Interpretabilidadeavançadotécnicopaper · Anthropic · 21 de mai. de 2024
  3. Grafos de atribuição mostram o modelo planejando rimas com antecedência — e cadeias de pensamento que não correspondem ao cálculo real

    A infidelidade da cadeia de pensamento é a razão técnica pela qual “ler o raciocínio” não é garantia de segurança — o que o system card do GPT-6 Astra acabou de admitir na prática.

    Interpretabilidadeavançadotécnicopaper · Anthropic · 27 de mar. de 2025