Acervo · Tema
Multimodal
Imagem, áudio, vídeo e texto no mesmo modelo — e o que isso custa.
GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens
É o dado mais claro até agora de que um modelo competitivo pode ser treinado e servido em escala sem hardware NVIDIA — e coloca trabalho agentivo de classe Opus a centavos.
CLIP: aprender imagem e texto no mesmo espaço, com 400 milhões de pares da web, foi o que abriu o multimodal moderno
Quase todo modelo multimodal atual, incluindo os “nativamente multimodais” desta semana, descende deste alinhamento entre modalidades.