Acervo · Tema
Interpretabilidade
O que acontece dentro do modelo: features, circuitos, fidelidade da cadeia de pensamento.
GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio
Para quem constrói, redefine o ponto de preço/desempenho da fronteira; para quem governa, é o primeiro flagship cujo próprio relatório admite que ler o raciocínio está ficando menos confiável.
Milhões de features interpretáveis extraídas de um modelo de produção — inclusive uma que faz o modelo achar que é a Golden Gate
Foi o momento em que interpretabilidade mecanicista saiu de modelos de brinquedo para um modelo que as pessoas usam.
Grafos de atribuição mostram o modelo planejando rimas com antecedência — e cadeias de pensamento que não correspondem ao cálculo real
A infidelidade da cadeia de pensamento é a razão técnica pela qual “ler o raciocínio” não é garantia de segurança — o que o system card do GPT-6 Astra acabou de admitir na prática.