Pular para o conteúdo
GenAI BR
Modelos abertosSaiu no Cinco nº 1 · No acervo desde 08 de set. de 2026

A Tencent abriu um MoE de 770B sob Apache 2.0 — e ele bate o Kimi K3 em código com um quarto dos parâmetros

Modelos abertostécnicotécnico, decisoranúncio · Tencent · 28 de ago. de 2026
Baixar cartão
O que é
O Hy4-preview é um mixture-of-experts de 770 bilhões de parâmetros, 49 bilhões ativos por token, 78 camadas, 256 especialistas roteados mais um compartilhado, com atenção esparsa e janela de 1 milhão de tokens. A Tencent publicou pesos, quantizações GGUF e uma API, e diz que é uma “versão inicial” com folga tanto em pré-treino quanto em pós-treino.
O que foi demonstrado
Autorreportado no model card: 65,7% no SWE-bench Pro (Kimi K3: 63,3%), 82,9% no SWE-bench Multilingual, 85,4% no Terminal-Bench 2.1, 92,3% no GPQA Diamond. Em avaliação humana cega contra o GLM-5.3, 46,8% de vitórias, 12,8% de empates, 40,4% de derrotas.
O que ainda não foi
Todos os números foram medidos pela própria Tencent; não há replicação independente nem relatório técnico. Dados e hardware de treino não foram divulgados. A empresa admite que o modelo “verifica demais” e raciocina por mais tempo do que precisa. Rodar em precisão cheia exige perto de 1,5 TB de VRAM — “aberto”, na prática, para laboratórios e nuvens.
Por que importa
É o maior lançamento de pesos abertos sob Apache 2.0 do período, e confirma o padrão: laboratórios chineses entregando codificadores agentivos perto da fronteira a uma fração do custo proprietário.

No mesmo tema

Modelos abertos
  1. GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens

    Infra e custotécnicotécnico, decisoranúncio · Z.ai · 26 de ago. de 2026
  2. DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda

    Infra e custotécnicotécnico, decisorpaper · DeepSeek · 27 de dez. de 2024
  3. DeepSeek-R1: reforço puro, sem exemplos humanos de raciocínio, fez o modelo aprender a se verificar

    Modelos abertostécnicotécnicopaper · DeepSeek · Nature 645 (2025) · 22 de jan. de 2025
  4. Llama 3: o relatório de 92 páginas que mostrou como se treina um modelo denso de 405B — e o que “aberto” queria dizer em 2024

    Modelos abertosintrodutóriotécnico, iniciantepaper · Meta · 31 de jul. de 2024

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.