Acervo
Trilhas
Sequências de leitura montadas com verbetes do acervo. Na ordem, cada leitura prepara a próxima.
Entenda agentes em seis leituras
Do loop pensar-agir-observar de 2022 ao benchmark que mostra onde os agentes de 2026 ainda falham. Na ordem, cada leitura prepara a próxima.
- ReAct: intercalar raciocínio e ação foi o que fez os primeiros agentes de linguagem funcionarem
- Workflows não são agentes: a distinção que evita a maioria dos projetos de agente que dão errado
- MCP virou o padrão de ferramentas para agentes — e desde dezembro de 2025 não pertence mais à Anthropic
- SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
- Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
- Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
Como saber se um modelo é bom
Benchmarks saturam, leaderboards são jogados, contextos longos não são usados. Seis leituras para ler um anúncio de lançamento sem ser enganado.
- HELM: a proposta de avaliar modelos em muitos cenários e muitas métricas ao mesmo tempo, não em um número só
- Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
- A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados
- SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
- Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
- GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio
IA no Brasil: o que está em jogo
A lei que não vota, a autoridade que testa antes de regular, e o dinheiro público que finalmente virou licitação. Três leituras para entender o tabuleiro.
- PL 2338: aprovado no Senado em dezembro de 2024, o marco legal da IA está parado na Câmara há dezesseis meses
- O sandbox de IA da ANPD tem três empresas testando explicabilidade sob a LGPD — e um segundo ciclo anunciado para o fim de 2026
- O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro