DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda
- O que é
- O relatório técnico descreve um MoE de 671 bilhões de parâmetros (37B ativos) com Multi-head Latent Attention, balanceamento de carga sem perda auxiliar e previsão multi-token, treinado em 14,8 trilhões de tokens em GPUs H800 — a versão restrita para exportação à China.
- O que foi demonstrado
- 2,788 milhões de horas-GPU de treino, sem picos de perda irrecuperáveis nem rollbacks; desempenho comparável a modelos fechados da época a uma fração do custo estimado.
- O que ainda não foi
- O número de horas-GPU cobre o treino final, não experimentos anteriores nem infraestrutura. Dados de treino não são descritos em detalhe.
- Por que importa
- Foi o relatório que fez o mercado repensar quanto custa treinar um modelo de fronteira — e a origem de várias técnicas que os modelos abertos de 2026 ainda usam.
No mesmo tema
Infra e custo→GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
O governo publicou a licitação de R$ 959 milhões do supercomputador de IA do Rio Grande do Norte — propostas até 8 de outubro
Janela de contexto grande não significa contexto usado: modelos perdem o que está no meio
PagedAttention: tratar o KV cache como memória virtual dobrou a vazão de inferência — e deu origem ao vLLM
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.