(Contrastive Language–Image Pre-training)
1) Einfach erklärt
CLIP ist ein KI-Modell, das Bilder und Texte miteinander verknüpft. Es lernt aus sehr vielen Bild-Text-Paaren aus dem Web, welcher Text zu welchem Bild gehört. Dafür gibt es zwei Encoder: einen Bild-Encoder und einen Text-Encoder. Beide wandeln Bild und Text in Vektoren um, die im gleichen Raum liegen. Stimmen Bild und Text zusammen, liegen ihre Vektoren nah beieinander.
Warum ist das nützlich?
- Zero-shot-Klassifikation: Ohne Nachtraining kann CLIP Klassen erkennen, indem man die Klassennamen als Sätze formuliert (z. B. „Ein Foto von einer Katze“). Das Bild wird dann dem passendsten Text zugeordnet.
- Suche & Retrieval: Man kann mit Text nach Bildern suchen (und umgekehrt), weil beide in einem gemeinsamen Bedeutungsraum liegen.
Weiterführende Basis-Einträge:
Multimodale KI ·
Große Sprachmodelle (LLMs) ·
Prompt (Anweisung) ·
Zero-shot
2) Professionelle Definition
CLIP (Radford et al., 2021) ist ein Dual-Encoder (Bild/Text) mit kontrastivem Lernziel: In einem Batch werden die passenden Bild-Text-Paare gegenüber unpassenden maximiert, sodass übereinstimmende Paare im Embedding-Raum nahe liegen (hohe Kosinus-Ähnlichkeit) und nicht-übereinstimmende weit entfernt sind. Trainiert wurde u. a. auf sehr großen Web-Datensätzen mit Bild-Text-Paaren.
Nach dem Pretraining nutzt man sprachliche Klassenbeschreibungen (Prompt-Templates) als Text-Prototypen im gemeinsamen Raum; die Zero-shot-Klassifikation erfolgt per Nearest-Neighbor (z. B. maximale Kosinus-Ähnlichkeit) zwischen Bild-Embedding und den Text-Embeddings der Klassenbeschreibungen. Die gleiche Einbettung ermöglicht Image↔Text-Retrieval.
Abgrenzung & Varianten: Neben CLIP gibt es konzeptionell ähnliche Dual-Encoder (z. B. ALIGN) sowie Abwandlungen (LiT, SigLIP, OpenCLIP). Andere Architekturen koppeln Vision-Encoder mit generativen Decodern oder LLMs (z. B. BLIP/BLIP-2, Flamingo, PaLI, LLaVA, Kosmos-1).
Beispiele multimodaler Architekturen (Auswahl)
- ALIGN (Google, 2021): Dual-Encoder auf sehr großen Web-Bild-Text-Paaren („noisy alt-text“); starke Zero-shot-/Retrieval-Leistungen.
- LiT – Locked-image Text Tuning (Google, 2021/22): Bild-Encoder eingefroren, nur der Text-Zweig wird kontrastiv angepasst; sehr starke Zero-shot-Transfers.
- SigLIP (Google, 2023): Sigmoid-Loss statt Softmax-Kontrastiv; robusteres Skalieren und teils bessere Zero-shot-Ergebnisse.
- OpenCLIP / LAION (2022): Open-Source-Reproduktion und Skalierungs-Studien mit großen offenen Datensätzen (LAION-400M/2B/5B).
- BLIP (Salesforce, 2022): Encoder-Decoder; nutzt gebootstrappte Captions; deckt Understanding & Generation ab.
- BLIP-2 (2023): Gefrorene Bild-Encoder + LLM, verbunden per Q-Former; starke Zero-shot-VQA bei viel weniger trainierbaren Parametern.
- Flamingo (DeepMind, 2022): VLM mit Cross-Attention auf visuelle Features + starker LLM-Backbone; Few-shot in multimodalen Aufgaben.
- PaLI / PaLI-X (Google, 2022/23): Skalierte Vision-/Sprach-Komponenten, multilingual, breite Aufgabenabdeckung (Captioning, VQA, OCR-frei u. a.).
- LLaVA (2023): Vision-Encoder + LLM mit Visual Instruction Tuning; offene Modelle, stark in multimodalen Chats.
- Kosmos-1 (Microsoft, 2023): Multimodales LLM; kann Instruktionen folgen, in-context lernen und Zero-shot ausführen.
Verwandte Begriffe:
Embedding/Vektorraum ·
Retrieval-Augmented Generation (RAG) / Hybride KI ·
Prompt ·
Zero-shot
Quellen (externe Belege; kopierbare, klickbare Links)
CLIP (OpenAI)
Blog (Jan 2021): https://openai.com/index/clip/
Paper (arXiv): https://arxiv.org/abs/2103.00020 |
PDF: https://arxiv.org/pdf/2103.00020
Paper (PMLR): https://proceedings.mlr.press/v139/radford21a/radford21a.pdf
ALIGN
Google-Research-Blog: https://research.google/blog/align-scaling-up-visual-and-vision-language-representation-learning-with-noisy-text-supervision/
Paper (arXiv): https://arxiv.org/abs/2102.05918 |
PDF (PMLR ICML 2021): https://proceedings.mlr.press/v139/jia21b/jia21b.pdf
LiT – Locked-image Text Tuning
Paper (arXiv): https://arxiv.org/abs/2111.07991 |
PDF (CVPR 2022): https://openaccess.thecvf.com/content/CVPR2022/papers/Zhai_LiT_Zero-Shot_Transfer_With_Locked-Image_Text_Tuning_CVPR_2022_paper.pdf
Google-Research-Blog: https://research.google/blog/locked-image-tuning-adding-language-understanding-to-image-models/
SigLIP
Paper (arXiv): https://arxiv.org/abs/2303.15343 |
PDF (ICCV 2023): https://openaccess.thecvf.com/content/ICCV2023/papers/Zhai_Sigmoid_Loss_for_Language_Image_Pre-Training_ICCV_2023_paper.pdf
OpenCLIP / LAION
Paper (arXiv): https://arxiv.org/abs/2212.07143 |
PDF: https://arxiv.org/pdf/2212.07143
LAION Blog: https://laion.ai/blog/large-openclip/
Repo (OpenCLIP): https://github.com/mlfoundations/open_clip
BLIP / BLIP-2
BLIP (arXiv): https://arxiv.org/abs/2201.12086 |
PDF (PMLR 2022): https://proceedings.mlr.press/v162/li22n/li22n.pdf
BLIP-2 (arXiv): https://arxiv.org/abs/2301.12597
Flamingo
Paper (arXiv): https://arxiv.org/abs/2204.14198 |
PDF (NeurIPS 2022): https://proceedings.neurips.cc/paper_files/paper/2022/file/960a172bc7fbf0177ccccbb411a7d800-Paper-Conference.pdf
PaLI / PaLI-X
PaLI (arXiv): https://arxiv.org/abs/2209.06794 |
PDF: https://arxiv.org/pdf/2209.06794
PaLI-X (arXiv): https://arxiv.org/pdf/2305.18565
LLaVA
Paper (arXiv): https://arxiv.org/abs/2304.08485 |
PDF: https://arxiv.org/pdf/2304.08485 |
Projektseite: https://llava-vl.github.io/
Kosmos-1
Paper (arXiv): https://arxiv.org/abs/2302.14045 |
PDF: https://arxiv.org/pdf/2302.14045