A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados
- O que é
- Singh, Hooker e coautores (Cohere Labs, Princeton, Stanford, MIT, AI2) analisaram a Chatbot Arena e documentaram práticas que distorcem o ranking: teste privado de múltiplas variantes antes do lançamento, retirada seletiva de resultados, e acesso desigual a dados de avaliação.
- O que foi demonstrado
- A Meta testou 27 variantes privadas antes do Llama 4; Google e OpenAI receberam ~19% e ~20% de todos os dados da Arena, contra ~30% para 83 modelos abertos somados; dados extras da Arena renderam até +112% de ganho na distribuição da própria Arena.
- O que ainda não foi
- Vários autores trabalham na Cohere, que compete na Arena. A organização da Arena contestou parte da metodologia e mudou políticas depois da publicação.
- Por que importa
- Se um ranking de preferência humana pode ser jogado, “nº 1 na Arena” deixa de ser um argumento de compra.
Aparece nas trilhas
No mesmo tema
Avaliação→Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.