Pular para o conteúdo
GenAI BR
Acervo · Tema2 verbetes neste tema

Multimodal

Imagem, áudio, vídeo e texto no mesmo modelo — e o que isso custa.

  1. GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens

    É o dado mais claro até agora de que um modelo competitivo pode ser treinado e servido em escala sem hardware NVIDIA — e coloca trabalho agentivo de classe Opus a centavos.

    Infra e custotécnicotécnico, decisoranúncio · Z.ai · 26 de ago. de 2026
  2. CLIP: aprender imagem e texto no mesmo espaço, com 400 milhões de pares da web, foi o que abriu o multimodal moderno

    Quase todo modelo multimodal atual, incluindo os “nativamente multimodais” desta semana, descende deste alinhamento entre modalidades.

    Multimodalintrodutóriotécnico, iniciantepaper · OpenAI · ICML 2021 · 26 de fev. de 2021