HELM: a proposta de avaliar modelos em muitos cenários e muitas métricas ao mesmo tempo, não em um número só
- O que é
- O Center for Research on Foundation Models, de Stanford, avaliou 30 modelos em 42 cenários com 7 métricas — acurácia, calibração, robustez, justiça, viés, toxicidade e eficiência — sob as mesmas condições, e publicou tudo.
- O que foi demonstrado
- A cobertura dos cenários centrais pelos modelos avaliados subiu de 17,9% para 96,0% — antes do HELM, a maioria dos modelos simplesmente não tinha sido testada nas mesmas coisas.
- O que ainda não foi
- De 2022: os cenários envelheceram e o projeto virou uma família de leaderboards. O princípio (multi-métrica, condições iguais, transparência) é o que permanece.
- Por que importa
- É a resposta metodológica ao problema dos benchmarks únicos — e o padrão que qualquer avaliação interna deveria copiar.
Aparece nas trilhas
No mesmo tema
Avaliação→Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.