Pular para o conteúdo
GenAI BR
Acervo3 trilhas

Trilhas

Sequências de leitura montadas com verbetes do acervo. Na ordem, cada leitura prepara a próxima.

  1. Entenda agentes em seis leituras

    Do loop pensar-agir-observar de 2022 ao benchmark que mostra onde os agentes de 2026 ainda falham. Na ordem, cada leitura prepara a próxima.

    1. ReAct: intercalar raciocínio e ação foi o que fez os primeiros agentes de linguagem funcionarem
    2. Workflows não são agentes: a distinção que evita a maioria dos projetos de agente que dão errado
    3. MCP virou o padrão de ferramentas para agentes — e desde dezembro de 2025 não pertence mais à Anthropic
    4. SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
    5. Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
    6. Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs
  2. Como saber se um modelo é bom

    Benchmarks saturam, leaderboards são jogados, contextos longos não são usados. Seis leituras para ler um anúncio de lançamento sem ser enganado.

    1. HELM: a proposta de avaliar modelos em muitos cenários e muitas métricas ao mesmo tempo, não em um número só
    2. Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
    3. A Ilusão do Leaderboard: como a Arena favorece quem testa variantes privadas e tem mais dados
    4. SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks
    5. Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento
    6. GPT-6 Astra: mesmo preço, novo teto nos benchmarks — e um system card que diz que ficou mais difícil monitorar o raciocínio
  3. IA no Brasil: o que está em jogo

    A lei que não vota, a autoridade que testa antes de regular, e o dinheiro público que finalmente virou licitação. Três leituras para entender o tabuleiro.

    1. PL 2338: aprovado no Senado em dezembro de 2024, o marco legal da IA está parado na Câmara há dezesseis meses
    2. O sandbox de IA da ANPD tem três empresas testando explicabilidade sob a LGPD — e um segundo ciclo anunciado para o fim de 2026
    3. O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro