SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
- O que é
- Jimenez e colegas (Princeton e Chicago) montaram 2.294 issues reais de 12 repositórios Python, com testes que definem se a correção funciona. Em 2024 a OpenAI publicou o subconjunto “Verified”, com 500 tarefas validadas por humanos, que virou o número de referência dos lançamentos.
- O que foi demonstrado
- Na publicação, o melhor modelo (Claude 2) resolvia 1,96%. Em setembro de 2026, avaliações independentes da Vals.ai colocam Claude Opus 5, GPT-5.6 Sol e GPT-5.6 Terra em 97,0% no Verified; agregadores autorreportados discordam da ordem.
- O que ainda não foi
- Saturado: com todos perto de 97%, o benchmark não separa mais os modelos. O resultado depende do harness (qual agente, quantas tentativas), e o leaderboard oficial mistura autorreporte e verificação. Só Python.
- Por que importa
- É o número que todo lançamento cita; saber como ele é medido é a diferença entre ler um anúncio e entendê-lo.
Aparece nas trilhas
No mesmo tema
Avaliação→Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.