1) Einfach erklärt
(Contrastive Language–Image Pre‑training) CLIP ist ein KI‑Modell, das Bilder und Texte miteinander verknüpft. Es lernt aus sehr vielen Bild‑Text‑Paaren aus dem Web, welcher Text zu welchem Bild gehört. Dazu gibt es zwei Encoder: einen Bild‑Encoder und einen Text‑Encoder. Beide wandeln Bild und Text in Vektoren um, die im gleichen Raum liegen. Stimmen Bild und Text zusammen, liegen ihre Vektoren nah beieinander.
Warum ist das nützlich?
- Zero‑shot‑Klassifikation: Ohne Nachtraining kann CLIP Klassen erkennen, indem man die Klassennamen als Sätze formuliert (z. B. „Ein Foto von einer Katze“). Das Bild wird dann dem passendsten Text zugeordnet.
- Suche & Retrieval: Man kann mit Text nach Bildern suchen (und umgekehrt), weil beide in einem gemeinsamen Bedeutungsraum liegen.
2) Professionelle Definition
CLIP (Radford et al., 2021) ist ein Dual‑Encoder (Bild/Text) mit kontrastivem Lernziel: In einem Batch werden die passenden Bild‑Text‑Paare gegenüber unpassenden maximiert, sodass übereinstimmende Paare im Embedding‑Raum nahe liegen (hohe Kosinus‑Ähnlichkeit) und nicht‑übereinstimmende weit entfernt sind. Trainiert wurde u. a. auf hunderten Millionen Web‑Bild‑Text‑Paaren.
Nach dem Pretraining nutzt man sprachliche Klassenbeschreibungen (Prompt‑Templates) als Text‑Prototypen im gemeinsamen Raum; die Zero‑shot‑Klassifikation erfolgt per Nearest‑Neighbor (z. B. Kosinusmaximierung) zwischen Bild‑Embedding und den Text‑Embeddings der Klassenbeschreibungen. Die gleiche Einbettung ermöglicht Image↔Text‑Retrieval.
Abgrenzung & Varianten: Neben CLIP gibt es konzeptionell ähnliche Dual‑Encoder (z. B. ALIGN) sowie Abwandlungen (LiT, SigLIP, OpenCLIP). Andere Architekturen koppeln Vision‑Encoder mit generativen Decoder(n) oder LLMs (z. B. BLIP/BLIP‑2, Flamingo, PaLI, LLaVA, Kosmos‑1).
Beispiele multimodaler Architekturen
- ALIGN (Google, 2021): Dual‑Encoder auf >1 Mrd. Web‑Bild‑Text‑Paaren („noisy alt‑text“); starke Zero‑shot‑/Retrieval‑Leistungen.
- LiT – Locked‑image Text Tuning (Google, 2021/22): Bild‑Encoder eingefroren, nur der Text‑Zweig wird kontrastiv angepasst; sehr starke Zero‑shot‑Transfers.
- SigLIP (Google, 2023): Sigmoid‑Loss statt Softmax‑Kontrastiv; robusteres Skalieren und teils bessere Zero‑shot‑Ergebnisse.
- OpenCLIP / LAION (2022): Open‑Source‑Reproduktion und Skalierungs‑Studien mit großen offenen Datensätzen (LAION‑400M/2B/5B).
- BLIP (Salesforce, 2022): Encoder‑Decoder‑Framework; nutzt gebootstrappte Captions und deckt Understanding & Generation ab.
- BLIP‑2 (2023): Gefrorene Bild‑Encoder + LLM, verbunden per Q‑Former; sehr gute Zero‑shot‑VQA bei viel weniger trainierbaren Parametern.
- Flamingo (DeepMind, 2022): VLM mit Cross‑Attention auf visuelle Features + starker LLM‑Backbone; Few‑shot in multimodalen Aufgaben.
- PaLI / PaLI‑X (Google, 2022/23): Skalierte Vision‑/Sprach‑Komponenten, multilingual, breite Aufgabenabdeckung (Captioning, VQA, OCR‑frei usw.).
- LLaVA (2023): Vision‑Encoder + LLM mit Visual Instruction Tuning; offene Modelle, stark in multimodalen Chats.
- Kosmos‑1 (Microsoft, 2023): Multimodales LLM; kann Instruktionen folgen, in‑context lernen und Zero‑shot ausführen.
Verwandte Begriffe: Embedding/Vektorraum, Retrieval‑Augmented Generation (RAG), Prompt, Zero‑shot.
Quellen
- Blog (Jan 2021): https://openai.com/index/clip/
- Paper (arXiv): https://arxiv.org/abs/2103.00020 | PDF: https://arxiv.org/pdf/2103.00020
- Paper (PMLR): https://proceedings.mlr.press/v139/radford21a/radford21a.pdf
ALIGN
- Blog (Google Research): https://research.google/blog/align-scaling-up-visual-and-vision-language-representation-learning-with-noisy-text-supervision/
- Paper (arXiv): https://arxiv.org/abs/2102.05918 | PDF (PMLR ICML 2021): https://proceedings.mlr.press/v139/jia21b/jia21b.pdf
LiT – Locked‑image Text Tuning
- Paper (arXiv): https://arxiv.org/abs/2111.07991 | PDF (CVPR 2022): https://openaccess.thecvf.com/content/CVPR2022/papers/Zhai_LiT_Zero-Shot_Transfer_With_Locked-Image_Text_Tuning_CVPR_2022_paper.pdf
- Blog (Google Research): https://research.google/blog/locked-image-tuning-adding-language-understanding-to-image-models/
SigLIP
- Paper (arXiv): https://arxiv.org/abs/2303.15343 | PDF (ICCV 2023): https://openaccess.thecvf.com/content/ICCV2023/papers/Zhai_Sigmoid_Loss_for_Language_Image_Pre-Training_ICCV_2023_paper.pdf
OpenCLIP / LAION
- Paper: https://arxiv.org/abs/2212.07143 | PDF: https://arxiv.org/pdf/2212.07143
- LAION Blog: https://laion.ai/blog/large-openclip/
- Repo (OpenCLIP): https://github.com/mlfoundations/open_clip
BLIP / BLIP‑2
- BLIP (arXiv): https://arxiv.org/abs/2201.12086 | PDF (PMLR 2022): https://proceedings.mlr.press/v162/li22n/li22n.pdf
- BLIP‑2 (arXiv): https://arxiv.org/abs/2301.12597
Flamingo
- Paper (arXiv): https://arxiv.org/abs/2204.14198 | PDF (NeurIPS 2022): https://proceedings.neurips.cc/paper_files/paper/2022/file/960a172bc7fbf0177ccccbb411a7d800-Paper-Conference.pdf
PaLI / PaLI‑X
- PaLI (arXiv): https://arxiv.org/abs/2209.06794 | PDF: https://arxiv.org/pdf/2209.06794
- PaLI‑X (arXiv): https://arxiv.org/pdf/2305.18565
LLaVA
- Paper (arXiv): https://arxiv.org/abs/2304.08485 | PDF: https://arxiv.org/pdf/2304.08485 | Projektseite: https://llava-vl.github.io/
Kosmos‑1
- Paper (arXiv): https://arxiv.org/abs/2302.14045 | PDF: https://arxiv.org/pdf/2302.14045