A Tencent abriu um MoE de 770B sob Apache 2.0 — e ele bate o Kimi K3 em código com um quarto dos parâmetros
- O que é
- O Hy4-preview é um mixture-of-experts de 770 bilhões de parâmetros, 49 bilhões ativos por token, 78 camadas, 256 especialistas roteados mais um compartilhado, com atenção esparsa e janela de 1 milhão de tokens. A Tencent publicou pesos, quantizações GGUF e uma API, e diz que é uma “versão inicial” com folga tanto em pré-treino quanto em pós-treino.
- O que foi demonstrado
- Autorreportado no model card: 65,7% no SWE-bench Pro (Kimi K3: 63,3%), 82,9% no SWE-bench Multilingual, 85,4% no Terminal-Bench 2.1, 92,3% no GPQA Diamond. Em avaliação humana cega contra o GLM-5.3, 46,8% de vitórias, 12,8% de empates, 40,4% de derrotas.
- O que ainda não foi
- Todos os números foram medidos pela própria Tencent; não há replicação independente nem relatório técnico. Dados e hardware de treino não foram divulgados. A empresa admite que o modelo “verifica demais” e raciocina por mais tempo do que precisa. Rodar em precisão cheia exige perto de 1,5 TB de VRAM — “aberto”, na prática, para laboratórios e nuvens.
- Por que importa
- É o maior lançamento de pesos abertos sob Apache 2.0 do período, e confirma o padrão: laboratórios chineses entregando codificadores agentivos perto da fronteira a uma fração do custo proprietário.
No mesmo tema
Modelos abertos→GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda
DeepSeek-R1: reforço puro, sem exemplos humanos de raciocínio, fez o modelo aprender a se verificar
Llama 3: o relatório de 92 páginas que mostrou como se treina um modelo denso de 405B — e o que “aberto” queria dizer em 2024
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.