Llama 3: o relatório de 92 páginas que mostrou como se treina um modelo denso de 405B — e o que “aberto” queria dizer em 2024
- O que é
- A Meta descreve a família Llama 3 (8B, 70B e 405B), densa, com janela de 128 mil tokens, treinada em cerca de 15 trilhões de tokens, com detalhes de dados, infraestrutura, pós-treino e avaliações que a maioria dos laboratórios não publica.
- O que foi demonstrado
- O 405B foi reportado como comparável ao GPT-4 em várias tarefas; a família virou a base de milhares de fine-tunings e produtos.
- O que ainda não foi
- Licença própria da Meta, não Apache nem MIT — “pesos abertos”, não open source. As avaliações comparativas são da própria Meta.
- Por que importa
- É a referência para entender o que muda quando um lançamento diz Apache 2.0 (Hy4) ou MIT (GLM-5.3-Flash) em vez de licença própria.
No mesmo tema
Modelos abertos→A Tencent abriu um MoE de 770B sob Apache 2.0 — e ele bate o Kimi K3 em código com um quarto dos parâmetros
GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda
DeepSeek-R1: reforço puro, sem exemplos humanos de raciocínio, fez o modelo aprender a se verificar
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.