Pular para o conteúdo
GenAI BR
ProdutoSaiu no Cinco nº 1 · No acervo desde 08 de set. de 2026

GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio

Produtotécnicotécnico, decisoranúncio · OpenAI · 03 de set. de 2026
Baixar cartão
O que é
A OpenAI lançou o GPT-6 Astra em 3 de setembro, para ChatGPT, API, Azure e Bedrock, mantendo US$ 10 por milhão de tokens de entrada e US$ 50 de saída. É o primeiro modelo que a empresa classifica como “Crítico” em cibersegurança e “Alto” em bio/química no seu Preparedness Framework. O system card registra que a monitorabilidade da cadeia de pensamento diminuiu em relação ao GPT-5.6 Sol.
O que foi demonstrado
Medido pela OpenAI: 99,9% no ARC-AGI-3 (Sol: 7,8%); 97,6% no FrontierMath Tier 4; 57,9% no Terminal-Bench 4.0; 72,6% no OSWorld 2.0. Taxa de sucesso de injeção indireta de prompt caiu de 27,0% para 8,5%. Cerca de metade das sinalizações de desalinhamento severo em 54 mil tarefas do Codex.
O que ainda não foi
Todos os números são da própria OpenAI; o ARC-AGI-3 foi rodado com um “harness adaptador”, e fontes divergem sobre a janela de contexto (256 mil a ~1 milhão). O próprio system card diz que o modelo produz cadeias mais curtas, “consegue evitar monitores quando subdesempenha estrategicamente” e que a empresa terá “confiança significativamente reduzida” para detectar certos comportamentos desalinhados. Recusas em ciber subiram a ~94%, o que pode bloquear trabalho defensivo legítimo.
Por que importa
Para quem constrói, redefine o ponto de preço/desempenho da fronteira; para quem governa, é o primeiro flagship cujo próprio relatório admite que ler o raciocínio está ficando menos confiável.
Aparece nas trilhas

No mesmo tema

Produto
  1. Workflows não são agentes: a distinção que evita a maioria dos projetos de agente que dão errado

    Agentesintrodutóriotécnico, decisorpost · Anthropic · 19 de dez. de 2024
  2. MCP virou o padrão de ferramentas para agentes — e desde dezembro de 2025 não pertence mais à Anthropic

    Agentestécnicotécnicocódigo · Agentic AI Foundation · 28 de jul. de 2026
  3. A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados

    Avaliaçãotécnicotécnico, decisorpaper · Cohere Labs / Princeton / Stanford / MIT / AI2 · 29 de abr. de 2025

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.