Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
- O que é
- Liu e colegas (Stanford, Berkeley, Samaya) mediram como modelos usam documentos longos, movendo a informação relevante de posição dentro do contexto. O desempenho desenha um U: alto quando a informação está no início ou no fim, e cai quando está no meio.
- O que foi demonstrado
- Queda significativa de acurácia em perguntas multi-documento e recuperação de chave-valor quando o item relevante está no meio, mesmo em modelos vendidos como “de contexto longo”.
- O que ainda não foi
- Publicado em 2023; modelos atuais reduziram o efeito, mas não o eliminaram. Vale medir no seu caso antes de confiar na janela anunciada.
- Por que importa
- Explica por que “jogar tudo no contexto” falha e por que RAG e ordenação de evidências continuam importando.
Aparece nas trilhas
No mesmo tema
Avaliação→Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.