GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
- O que é
- A Z.ai revelou que o modelo anônimo “Ox Alpha” do OpenRouter era o GLM-5.3-Flash: um MoE de 320B com 18B ativos, nativamente multimodal, treinado em um corpus de 30 trilhões de tokens, com atenção híbrida esparsa e linear. Os pesos saíram sob licença MIT. A empresa afirma que serve o modelo em aceleradores domésticos, a cerca de 100 trilhões de tokens por dia.
- O que foi demonstrado
- Preço de API: US$ 0,15 por milhão de tokens de entrada e US$ 0,50 de saída. Autorreportado: 84,3 no Terminal-Bench 2.1, 63,4 no DeepSWE v1.1 (GLM-5.2: 46,2). Índice de inteligência da Artificial Analysis (terceiro): 57. A Z.ai diz que a nova atenção corta o cálculo em ~3× e o KV cache em ~4,4× em relação ao GLM-5.3.
- O que ainda não foi
- A afirmação “só chips chineses” é da própria Z.ai; o acelerador e a quantidade não estão documentados. As comparações de benchmark no model card estão em imagem, não em tabela, e as avaliações limitam o contexto a 300 mil tokens apesar da janela de 1 milhão. O paper vinculado é o relatório do GLM-5, de fevereiro, não deste modelo.
- Por que importa
- É o dado mais claro até agora de que um modelo competitivo pode ser treinado e servido em escala sem hardware NVIDIA — e coloca trabalho agentivo de classe Opus a centavos.
No mesmo tema
Infra e custo→O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda
PagedAttention: tratar o KV cache como memória virtual dobrou a vazão de inferência — e deu origem ao vLLM
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.