Entenda agentes em seis leituras
Do loop pensar-agir-observar de 2022 ao benchmark que mostra onde os agentes de 2026 ainda falham. Na ordem, cada leitura prepara a próxima.
ReAct: intercalar raciocínio e ação foi o que fez os primeiros agentes de linguagem funcionarem
Se você vai construir um agente, este é o ponto de partida conceitual: o loop pensar-agir-observar.
Workflows não são agentes: a distinção que evita a maioria dos projetos de agente que dão errado
É o vocabulário que times de produto e engenharia precisam compartilhar antes de discutir “colocar um agente” em qualquer coisa.
MCP virou o padrão de ferramentas para agentes — e desde dezembro de 2025 não pertence mais à Anthropic
Quem constrói integrações para agentes hoje constrói sobre MCP; saber quem governa o padrão é saber de quem depende a sua integração.
SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
É o número que todo lançamento cita; saber como ele é medido é a diferença entre ler um anúncio e entendê-lo.
Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
É o benchmark que hoje discrimina entre modelos de fronteira em trabalho agentivo — e o que vai aparecer nas próximas manchetes.
Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
Quantifica a distância entre leaderboards saturados e engenharia de domínio de verdade — exatamente onde engenheiros vão ser cobrados para colocar agentes a seguir.
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.