CLIP: aprender imagem e texto no mesmo espaço, com 400 milhões de pares da web, foi o que abriu o multimodal moderno
- O que é
- Radford e colegas (OpenAI) treinaram um codificador de imagem e um de texto para aproximar pares corretos e afastar pares errados, usando 400 milhões de pares imagem-legenda coletados da web, sem rótulos manuais.
- O que foi demonstrado
- Classificação zero-shot: 76,2% de acurácia no ImageNet sem usar nenhum dos 1,28 milhão de exemplos de treino, igualando um ResNet-50 supervisionado; transferência para mais de 30 conjuntos de dados.
- O que ainda não foi
- Fraco em tarefas finas e de contagem; herda vieses dos dados da web. É de 2021 — a base conceitual, não o estado da arte.
- Por que importa
- Quase todo modelo multimodal atual, incluindo os “nativamente multimodais” desta semana, descende deste alinhamento entre modalidades.
No mesmo tema
Multimodal→Receba o próximo Cinco
Terça, 7h, no seu e-mail. Cinco itens, com fonte. Sem newsletter diária, sem promoção, e o descadastro é um clique.