Pular para o conteúdo
GenAI BR
Acervo · Tema7 verbetes neste tema

Agentes

Sistemas que planejam, usam ferramentas e agem — e como saber quando funcionam.

  1. A Tencent abriu um MoE de 770B sob Apache 2.0 — e ele bate o Kimi K3 em código com um quarto dos parâmetros

    É o maior lançamento de pesos abertos sob Apache 2.0 do período, e confirma o padrão: laboratórios chineses entregando codificadores agentivos perto da fronteira a uma fração do custo proprietário.

    Modelos abertostécnicotécnico, decisoranúncio · Tencent · 28 de ago. de 2026
  2. Em software científico de verdade, o melhor agente de código resolve menos da metade dos bugs

    Quantifica a distância entre leaderboards saturados e engenharia de domínio de verdade — exatamente onde engenheiros vão ser cobrados para colocar agentes a seguir.

    Avaliaçãotécnicotécnicopaper · Universidade Fudan · 01 de set. de 2026
  3. ReAct: intercalar raciocínio e ação foi o que fez os primeiros agentes de linguagem funcionarem

    Se você vai construir um agente, este é o ponto de partida conceitual: o loop pensar-agir-observar.

    Agentesintrodutóriotécnico, iniciantepaper · Princeton / Google Brain · ICLR 2023 · 06 de out. de 2022
  4. Workflows não são agentes: a distinção que evita a maioria dos projetos de agente que dão errado

    É o vocabulário que times de produto e engenharia precisam compartilhar antes de discutir “colocar um agente” em qualquer coisa.

    Agentesintrodutóriotécnico, decisorpost · Anthropic · 19 de dez. de 2024
  5. MCP virou o padrão de ferramentas para agentes — e desde dezembro de 2025 não pertence mais à Anthropic

    Quem constrói integrações para agentes hoje constrói sobre MCP; saber quem governa o padrão é saber de quem depende a sua integração.

    Agentestécnicotécnicocódigo · Agentic AI Foundation · 28 de jul. de 2026
  6. SWE-bench: o benchmark de código que saiu de 2% para 97% em três anos — e o que isso diz sobre benchmarks

    É o número que todo lançamento cita; saber como ele é medido é a diferença entre ler um anúncio e entendê-lo.

    Avaliaçãotécnicotécnicopaper · Princeton / UChicago · ICLR 2024 · 10 de out. de 2023
  7. Terminal-Bench: 89 tarefas de terminal verificadas à mão, e o benchmark que substituiu o SWE-bench nos decks de lançamento

    É o benchmark que hoje discrimina entre modelos de fronteira em trabalho agentivo — e o que vai aparecer nas próximas manchetes.

    Avaliaçãotécnicotécnicopaper · Laude Institute / Stanford · 17 de jan. de 2026