Pular para o conteúdo
GenAI BR
AvaliaçãoSaiu no Cinco nº 1 · No acervo desde 08 de set. de 2026

Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs

Avaliaçãotécnicotécnicopaper · Universidade Fudan · 01 de set. de 2026
Baixar cartão
O que é
O SWE-bench Science, do grupo OpenMOSS da Universidade Fudan, reúne 119 issues reais de 98 repositórios em 20 domínios científicos — imagem, espectroscopia, simulação. As falhas envolvem unidades, sistemas de coordenadas, invariantes numéricos e premissas físicas, não lógica pura. Os autores propõem uma taxonomia de quatro mecanismos de falha e testam se injetar orientação científica ajuda.
O que foi demonstrado
Leaderboard em 1º de setembro: Claude Opus 5 (esforço máximo) 47,9%; DeepSeek-V4-Pro 42,0%; GPT-5.6 Sol 40,3%; Kimi K3 35,3%; GLM-5.2 31,9%. Os mesmos modelos passam de 95% no SWE-bench Verified. Orientação bem fundamentada ajuda; orientação mal calibrada provoca ancoragem e piora o resultado.
O que ainda não foi
Amostra pequena (119 tarefas): diferenças de poucos pontos entre modelos ficam dentro do ruído. Grupo acadêmico sem vínculo com fornecedores, mas o custo de rodar limita replicações. Preprint v2, ainda sem revisão por pares. Não confundir com o “Terminal-Bench-Science 0.1”, que aparece nos decks de lançamento desta semana.
Por que importa
Quantifica a distância entre leaderboards saturados e engenharia de domínio de verdade — exatamente onde engenheiros vão ser cobrados para colocar agentes a seguir.
Aparece nas trilhas

No mesmo tema

Avaliação
  1. SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks

    Avaliaçãotécnicotécnicopaper · Princeton / UChicago · ICLR 2024 · 10 de out. de 2023
  2. Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento

    Avaliaçãotécnicotécnicopaper · Laude Institute / Stanford · 17 de jan. de 2026
  3. Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio

    Avaliaçãointrodutóriotécnico, iniciantepaper · Stanford / UC Berkeley / Samaya · TACL 2023 · 06 de jul. de 2023
  4. A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados

    Avaliaçãotécnicotécnico, decisorpaper · Cohere Labs / Princeton / Stanford / MIT / AI2 · 29 de abr. de 2025

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.