Pular para o conteúdo
GenAI BR
MultimodalNo acervo desde 06 de set. de 2026

CLIP: aprender imagem e texto no mesmo espaço, com 400 milhões de pares da web, foi o que abriu o multimodal moderno

Multimodalintrodutóriotécnico, iniciantepaper · OpenAI · ICML 2021 · 26 de fev. de 2021
Baixar cartão
O que é
Radford e colegas (OpenAI) treinaram um codificador de imagem e um de texto para aproximar pares corretos e afastar pares errados, usando 400 milhões de pares imagem-legenda coletados da web, sem rótulos manuais.
O que foi demonstrado
Classificação zero-shot: 76,2% de acurácia no ImageNet sem usar nenhum dos 1,28 milhão de exemplos de treino, igualando um ResNet-50 supervisionado; transferência para mais de 30 conjuntos de dados.
O que ainda não foi
Fraco em tarefas finas e de contagem; herda vieses dos dados da web. É de 2021 — a base conceitual, não o estado da arte.
Por que importa
Quase todo modelo multimodal atual, incluindo os “nativamente multimodais” desta semana, descende deste alinhamento entre modalidades.

No mesmo tema

Multimodal
  1. GLM-5.3-Flash: um modelo MIT de 320B servido inteiramente em chips chineses, a US$ 0,15 por milhão de tokens

    Infra e custotécnicotécnico, decisoranúncio · Z.ai · 26 de ago. de 2026

Receba o próximo Cinco

Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.

Só o e-mail. Nada de rastreador de terceiros nesta página. Política de privacidade.