Acervo
Glossário
Os termos que aparecem no Cinco, em português, sem simplificar demais.
- Agente
- Sistema em que o modelo decide o próprio caminho: escolhe ferramentas, observa resultados e repete até concluir. Diferente de um workflow, em que o caminho é código fixo.
- Workflows não são agentesReAct
- Alucinação
- Saída fluente e confiante que não corresponde a fato ou a fonte. Não é bug ocasional; é consequência de como o modelo gera texto, e se mitiga com fontes, verificação e recusa.
- Benchmark
- Conjunto fixo de tarefas com resposta verificável, usado para comparar modelos. Satura quando todos acertam quase tudo; contamina quando as respostas vazam para o treino.
- SWE-benchHELM
- Cadeia de pensamento
- Texto intermediário que o modelo produz antes da resposta, “raciocinando” por escrito. Melhora resultados em tarefas de passos; não é necessariamente fiel ao cálculo interno.
- Grafos de atribuição mostram o modelo planejando
- Contaminação
- Quando exemplos de um benchmark (ou algo muito parecido) estavam nos dados de treino do modelo, inflando a nota sem inflar a capacidade.
- Destilação
- Treinar um modelo menor para imitar as saídas de um maior. É como boa parte da capacidade de raciocínio chegou a modelos pequenos.
- DeepSeek-R1
- Fine-tuning
- Continuar o treino de um modelo pronto com dados específicos para uma tarefa ou domínio. Barato em relação ao pré-treino; fácil de estragar sem avaliação.
- Inferência
- Rodar o modelo para gerar respostas (em oposição a treiná-lo). É onde mora o custo recorrente e a latência.
- PagedAttention
- Janela de contexto
- Quantidade máxima de tokens que o modelo recebe de uma vez. A janela anunciada e a janela efetivamente usada não são a mesma coisa.
- Janela de contexto grande não significa contexto
- KV cache
- Memória em que o modelo guarda chaves e valores de atenção já calculados para não recalculá-los a cada token. Domina o uso de memória na inferência de contextos longos.
- PagedAttention
- LGPD
- Lei Geral de Proteção de Dados (13.709/2018). O artigo 20 — direito à revisão de decisões automatizadas — é o ponto de contato mais direto com sistemas de IA hoje.
- O sandbox de IA da ANPD tem três empresas testan
- Licença de pesos
- Termos sob os quais os pesos de um modelo podem ser usados. Apache 2.0 e MIT são permissivas; licenças próprias (como a do Llama) impõem restrições. “Pesos abertos” não é o mesmo que open source.
- Llama 3A Tencent abriu um MoE de 770B sob Apache 2.0 —
- MCP
- Model Context Protocol: padrão aberto para expor ferramentas e dados a modelos, hoje governado pela Agentic AI Foundation (Linux Foundation).
- MCP virou o padrão de ferramentas para agentes —
- Mixture of Experts (MoE)
- Arquitetura em que só uma fração dos parâmetros (“especialistas”) é ativada por token. Por isso um modelo de 770B pode custar como um de 49B para rodar — mas ainda precisa de memória para os 770B.
- A Tencent abriu um MoE de 770B sob Apache 2.0 — DeepSeek-V3
- Monitorabilidade
- Quanto dá para detectar comportamento indesejado de um modelo lendo o seu raciocínio. Cai quando o modelo produz cadeias mais curtas ou infiéis.
- GPT-6 AstraGrafos de atribuição mostram o modelo planejando
- Parâmetros ativos
- Em um MoE, os parâmetros efetivamente usados para processar cada token. Determinam o custo de computação; os parâmetros totais determinam a memória.
- PBIA
- Plano Brasileiro de Inteligência Artificial (2024–2028), com R$ 23 bilhões anunciados. A execução até 2025 ficou muito abaixo do anúncio; a licitação do supercomputador do RN é o primeiro grande desembolso concreto.
- O governo publicou a licitação de R$ 959 milhões
- PL 2338/2023
- Projeto de lei do marco regulatório da IA no Brasil, baseado em risco. Aprovado no Senado em dezembro de 2024; aguarda parecer na Câmara.
- PL 2338
- Quantização
- Guardar os pesos com menos bits (8, 4, até 2) para caber em menos memória e rodar mais rápido, com alguma perda de qualidade. É o que permite rodar modelos grandes fora do datacenter.
- RAG
- Retrieval-augmented generation: buscar documentos relevantes e colocá-los no contexto antes de gerar. Alternativa a confiar na memória do modelo — e a jogar tudo na janela.
- Janela de contexto grande não significa contexto
- Recompensa verificável
- Sinal de treino que pode ser checado automaticamente (a conta bate, o teste passa). É o que torna possível o aprendizado por reforço de raciocínio sem exemplos humanos.
- DeepSeek-R1
- Sparse autoencoder (SAE)
- Rede treinada para decompor as ativações de um modelo em muitas features esparsas e, com sorte, legíveis. Ferramenta central da interpretabilidade recente.
- Milhões de features interpretáveis extraídas de
- System card
- Documento que um laboratório publica com avaliações de capacidade e risco de um modelo. Vale ler as seções de limitações antes das de resultados.
- GPT-6 Astra
- Throughput (vazão)
- Tokens processados por segundo por um servidor de inferência. Junto com a latência, define o custo real de servir um modelo.
- Token
- Unidade em que o modelo lê e escreve texto — pedaços de palavra. Em português, uma palavra costuma virar mais tokens do que em inglês, o que encarece a mesma frase.