DeepSeek-R1: reforço puro, sem exemplos humanos de raciocínio, fez o modelo aprender a se verificar
- O que é
- O R1-Zero foi treinado apenas com aprendizado por reforço sobre recompensas verificáveis (respostas certas em matemática e código), sem dados supervisionados de raciocínio; o R1 adiciona uma etapa de dados frios e mais treino. O trabalho foi publicado na Nature em 2025, e os pesos são abertos.
- O que foi demonstrado
- Comportamentos de autorreflexão e verificação emergiram do reforço; versões destiladas para modelos pequenos (1,5B a 70B) transferiram parte da capacidade.
- O que ainda não foi
- O R1-Zero misturava línguas e era pouco legível; a receita exige recompensas verificáveis, o que limita o método a domínios com resposta certa. Custo de inferência do raciocínio longo é alto.
- Por que importa
- Definiu a receita de “modelos de raciocínio” abertos que a China vem iterando desde então.
No mesmo tema
Modelos abertos→A Tencent abriu um MoE de 770B sob Apache 2.0 — e ele bate o Kimi K3 em código com um quarto dos parâmetros
GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
DeepSeek-V3: um modelo de 671B treinado em 2,79 milhões de horas de H800, sem um único pico de perda
Llama 3: o relatório de 92 páginas que mostrou como se treina um modelo denso de 405B — e o que “aberto” queria dizer em 2024
Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.