Pular para o conteúdo
GenAI BR
Acervo · Tema5 verbetes neste tema

Infra e custo

Inferência, GPUs, preço por token, e o que muda quando o custo cai dez vezes.

  1. GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens

    É o dado mais claro até agora de que um modelo competitivo pode ser treinado e servido em escala sem hardware NVIDIA — e coloca trabalho agentivo de classe Opus a centavos.

    Infra e custotécnicotécnico, decisoranúncio · Z.ai · 26 de ago. de 2026
  2. O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro

    É o primeiro passo concreto, datado e financiado rumo a capacidade soberana de computação para IA no Brasil — e os termos da licitação vão definir quais pilhas os engenheiros daqui poderão usar.

    Regulação e Brasilintrodutóriotécnico, decisor, inicianteanúncio · Governo Federal · 21 de ago. de 2026
  3. Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio

    Explica por que “jogar tudo no contexto” falha e por que RAG e ordenação de evidências continuam importando.

    Avaliaçãointrodutóriotécnico, iniciantepaper · Stanford / UC Berkeley / Samaya · TACL 2023 · 06 de jul. de 2023
  4. DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda

    Foi o relatório que fez o mercado repensar quanto custa treinar um modelo de fronteira — e a origem de várias técnicas que os modelos abertos de 2026 ainda usam.

    Infra e custotécnicotécnico, decisorpaper · DeepSeek · 27 de dez. de 2024
  5. PagedAttention: tratar o KV cache como memória virtual dobrou a vazão de inferência — e deu origem ao vLLM

    Custo por token é, em grande parte, custo de memória; este é o paper que explica por que.

    Infra e custotécnicotécnicopaper · UC Berkeley · SOSP 2023 · 12 de set. de 2023