Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
- O que é
- Merrill, Shaw, Carlini e mais de sessenta coautores (Laude Institute, Stanford e outros) publicaram em janeiro de 2026 um conjunto de tarefas realistas em linha de comando — configurar ambientes, depurar, compilar, processar dados — com verificação por testes. O benchmark é “contínuo”: a versão atual no Harbor Hub é a 4.0.
- O que foi demonstrado
- Na publicação (2.0), os melhores agentes ficavam abaixo de 65%. Em setembro de 2026, os fornecedores citam a 4.0: GPT-6 Astra 57,9%, Claude Fable 5.1 55,8%.
- O que ainda não foi
- Versões mudam de conteúdo; comparar números de versões diferentes é erro comum. Os números de fornecedores são autorreportados.
- Por que importa
- É o benchmark que hoje discrimina entre modelos de fronteira em trabalho agentivo — e o que vai aparecer nas próximas manchetes.
Aparece nas trilhas
No mesmo tema
Avaliação→Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.