Pular para o conteúdo
GenAI BR
Infra e custoSaiu no Cinco nº 1 · No acervo desde 08 de set. de 2026

GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens

Infra e custotécnicotécnico, decisoranúncio · Z.ai · 26 de ago. de 2026
Baixar cartão
O que é
A Z.ai revelou que o modelo anônimo “Ox Alpha” do OpenRouter era o GLM-5.3-Flash: um MoE de 320B com 18B ativos, nativamente multimodal, treinado em um corpus de 30 trilhões de tokens, com atenção híbrida esparsa e linear. Os pesos saíram sob licença MIT. A empresa afirma que serve o modelo em aceleradores domésticos, a cerca de 100 trilhões de tokens por dia.
O que foi demonstrado
Preço de API: US$ 0,15 por milhão de tokens de entrada e US$ 0,50 de saída. Autorreportado: 84,3 no Terminal-Bench 2.1, 63,4 no DeepSWE v1.1 (GLM-5.2: 46,2). Índice de inteligência da Artificial Analysis (terceiro): 57. A Z.ai diz que a nova atenção corta o cálculo em ~3× e o KV cache em ~4,4× em relação ao GLM-5.3.
O que ainda não foi
A afirmação “só chips chineses” é da própria Z.ai; o acelerador e a quantidade não estão documentados. As comparações de benchmark no model card estão em imagem, não em tabela, e as avaliações limitam o contexto a 300 mil tokens apesar da janela de 1 milhão. O paper vinculado é o relatório do GLM-5, de fevereiro, não deste modelo.
Por que importa
É o dado mais claro até agora de que um modelo competitivo pode ser treinado e servido em escala sem hardware NVIDIA — e coloca trabalho agentivo de classe Opus a centavos.

No mesmo tema

Infra e custo
  1. O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro

    Regulação e Brasilintrodutóriotécnico, decisor, inicianteanúncio · Governo Federal · 21 de ago. de 2026
  2. Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio

    Avaliaçãointrodutóriotécnico, iniciantepaper · Stanford / UC Berkeley / Samaya · TACL 2023 · 06 de jul. de 2023
  3. DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda

    Infra e custotécnicotécnico, decisorpaper · DeepSeek · 27 de dez. de 2024
  4. PagedAttention: tratar o KV cache como memória virtual dobrou a vazão de inferência — e deu origem ao vLLM

    Infra e custotécnicotécnicopaper · UC Berkeley · SOSP 2023 · 12 de set. de 2023

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.