Pular para o conteúdo
GenAI BR
Trilhas

Como saber se um modelo é bom

Benchmarks saturam, leaderboards são jogados, contextos longos não são usados. Seis leituras para ler um anúncio de lançamento sem ser enganado.

6 leituras
  1. Leitura 1 de 6

    HELM: a proposta de avaliar modelos em muitos cenários e muitas métricas ao mesmo tempo, não em um número só

    É a resposta metodológica ao problema dos benchmarks únicos — e o padrão que qualquer avaliação interna deveria copiar.

    Avaliaçãointrodutóriotécnico, iniciantepaper · Stanford CRFM · TMLR 2023 · 16 de nov. de 2022
  2. Leitura 2 de 6

    Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio

    Explica por que “jogar tudo no contexto” falha e por que RAG e ordenação de evidências continuam importando.

    Avaliaçãointrodutóriotécnico, iniciantepaper · Stanford / UC Berkeley / Samaya · TACL 2023 · 06 de jul. de 2023
  3. Leitura 3 de 6

    A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados

    Se um ranking de preferência humana pode ser jogado, “nº 1 na Arena” deixa de ser um argumento de compra.

    Avaliaçãotécnicotécnico, decisorpaper · Cohere Labs / Princeton / Stanford / MIT / AI2 · 29 de abr. de 2025
  4. Leitura 4 de 6

    SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks

    É o número que todo lançamento cita; saber como ele é medido é a diferença entre ler um anúncio e entendê-lo.

    Avaliaçãotécnicotécnicopaper · Princeton / UChicago · ICLR 2024 · 10 de out. de 2023
  5. Leitura 5 de 6

    Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento

    É o benchmark que hoje discrimina entre modelos de fronteira em trabalho agentivo — e o que vai aparecer nas próximas manchetes.

    Avaliaçãotécnicotécnicopaper · Laude Institute / Stanford · 17 de jan. de 2026
  6. Leitura 6 de 6

    GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio

    Para quem constrói, redefine o ponto de preço/desempenho da fronteira; para quem governa, é o primeiro flagship cujo próprio relatório admite que ler o raciocínio está ficando menos confiável.

    Produtotécnicotécnico, decisoranúncio · OpenAI · 03 de set. de 2026

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.