Pular para o conteúdo
GenAI BR
Acervo25 termos

Glossário

Os termos que aparecem no Cinco, em português, sem simplificar demais.

Agente
Sistema em que o modelo decide o próprio caminho: escolhe ferramentas, observa resultados e repete até concluir. Diferente de um workflow, em que o caminho é código fixo.
Ver no acervo:Workflows não são agentesReAct
Alucinação
Saída fluente e confiante que não corresponde a fato ou a fonte. Não é bug ocasional; é consequência de como o modelo gera texto, e se mitiga com fontes, verificação e recusa.
Benchmark
Conjunto fixo de tarefas com resposta verificável, usado para comparar modelos. Satura quando todos acertam quase tudo; contamina quando as respostas vazam para o treino.
Ver no acervo:SWE-benchHELM
Cadeia de pensamento
Texto intermediário que o modelo produz antes da resposta, “raciocinando” por escrito. Melhora resultados em tarefas de passos; não é necessariamente fiel ao cálculo interno.
Ver no acervo:Grafos de atribuição mostram o modelo planejando
Contaminação
Quando exemplos de um benchmark (ou algo muito parecido) estavam nos dados de treino do modelo, inflando a nota sem inflar a capacidade.
Destilação
Treinar um modelo menor para imitar as saídas de um maior. É como boa parte da capacidade de raciocínio chegou a modelos pequenos.
Ver no acervo:DeepSeek-R1
Fine-tuning
Continuar o treino de um modelo pronto com dados específicos para uma tarefa ou domínio. Barato em relação ao pré-treino; fácil de estragar sem avaliação.
Inferência
Rodar o modelo para gerar respostas (em oposição a treiná-lo). É onde mora o custo recorrente e a latência.
Ver no acervo:PagedAttention
Janela de contexto
Quantidade máxima de tokens que o modelo recebe de uma vez. A janela anunciada e a janela efetivamente usada não são a mesma coisa.
Ver no acervo:Janela de contexto grande não significa contexto
KV cache
Memória em que o modelo guarda chaves e valores de atenção já calculados para não recalculá-los a cada token. Domina o uso de memória na inferência de contextos longos.
Ver no acervo:PagedAttention
LGPD
Lei Geral de Proteção de Dados (13.709/2018). O artigo 20 — direito à revisão de decisões automatizadas — é o ponto de contato mais direto com sistemas de IA hoje.
Ver no acervo:O sandbox de IA da ANPD tem três empresas testan
Licença de pesos
Termos sob os quais os pesos de um modelo podem ser usados. Apache 2.0 e MIT são permissivas; licenças próprias (como a do Llama) impõem restrições. “Pesos abertos” não é o mesmo que open source.
Ver no acervo:Llama 3A Tencent abriu um MoE de 770B sob Apache 2.0 —
MCP
Model Context Protocol: padrão aberto para expor ferramentas e dados a modelos, hoje governado pela Agentic AI Foundation (Linux Foundation).
Ver no acervo:MCP virou o padrão de ferramentas para agentes —
Mixture of Experts (MoE)
Arquitetura em que só uma fração dos parâmetros (“especialistas”) é ativada por token. Por isso um modelo de 770B pode custar como um de 49B para rodar — mas ainda precisa de memória para os 770B.
Ver no acervo:A Tencent abriu um MoE de 770B sob Apache 2.0 — DeepSeek-V3
Monitorabilidade
Quanto dá para detectar comportamento indesejado de um modelo lendo o seu raciocínio. Cai quando o modelo produz cadeias mais curtas ou infiéis.
Ver no acervo:GPT-6 AstraGrafos de atribuição mostram o modelo planejando
Parâmetros ativos
Em um MoE, os parâmetros efetivamente usados para processar cada token. Determinam o custo de computação; os parâmetros totais determinam a memória.
PBIA
Plano Brasileiro de Inteligência Artificial (2024–2028), com R$ 23 bilhões anunciados. A execução até 2025 ficou muito abaixo do anúncio; a licitação do supercomputador do RN é o primeiro grande desembolso concreto.
Ver no acervo:O governo publicou a licitação de R$ 959 milhões
PL 2338/2023
Projeto de lei do marco regulatório da IA no Brasil, baseado em risco. Aprovado no Senado em dezembro de 2024; aguarda parecer na Câmara.
Ver no acervo:PL 2338
Quantização
Guardar os pesos com menos bits (8, 4, até 2) para caber em menos memória e rodar mais rápido, com alguma perda de qualidade. É o que permite rodar modelos grandes fora do datacenter.
RAG
Retrieval-augmented generation: buscar documentos relevantes e colocá-los no contexto antes de gerar. Alternativa a confiar na memória do modelo — e a jogar tudo na janela.
Ver no acervo:Janela de contexto grande não significa contexto
Recompensa verificável
Sinal de treino que pode ser checado automaticamente (a conta bate, o teste passa). É o que torna possível o aprendizado por reforço de raciocínio sem exemplos humanos.
Ver no acervo:DeepSeek-R1
Sparse autoencoder (SAE)
Rede treinada para decompor as ativações de um modelo em muitas features esparsas e, com sorte, legíveis. Ferramenta central da interpretabilidade recente.
Ver no acervo:Milhões de features interpretáveis extraídas de
System card
Documento que um laboratório publica com avaliações de capacidade e risco de um modelo. Vale ler as seções de limitações antes das de resultados.
Ver no acervo:GPT-6 Astra
Throughput (vazão)
Tokens processados por segundo por um servidor de inferência. Junto com a latência, define o custo real de servir um modelo.
Token
Unidade em que o modelo lê e escreve texto — pedaços de palavra. Em português, uma palavra costuma virar mais tokens do que em inglês, o que encarece a mesma frase.