(Contrastive Language–Image Pre-training)

1) Einfach erklärt

CLIP ist ein KI-Modell, das Bilder und Texte miteinander verknüpft. Es lernt aus sehr vielen Bild-Text-Paaren aus dem Web, welcher Text zu welchem Bild gehört. Dafür gibt es zwei Encoder: einen Bild-Encoder und einen Text-Encoder. Beide wandeln Bild und Text in Vektoren um, die im gleichen Raum liegen. Stimmen Bild und Text zusammen, liegen ihre Vektoren nah beieinander.

Warum ist das nützlich?

  • Zero-shot-Klassifikation: Ohne Nachtraining kann CLIP Klassen erkennen, indem man die Klassennamen als Sätze formuliert (z. B. „Ein Foto von einer Katze“). Das Bild wird dann dem passendsten Text zugeordnet.
  • Suche & Retrieval: Man kann mit Text nach Bildern suchen (und umgekehrt), weil beide in einem gemeinsamen Bedeutungsraum liegen.

Weiterführende Basis-Einträge:
Multimodale KI ·
Große Sprachmodelle (LLMs) ·
Prompt (Anweisung) ·
Zero-shot


2) Professionelle Definition

CLIP (Radford et al., 2021) ist ein Dual-Encoder (Bild/Text) mit kontrastivem Lernziel: In einem Batch werden die passenden Bild-Text-Paare gegenüber unpassenden maximiert, sodass übereinstimmende Paare im Embedding-Raum nahe liegen (hohe Kosinus-Ähnlichkeit) und nicht-übereinstimmende weit entfernt sind. Trainiert wurde u. a. auf sehr großen Web-Datensätzen mit Bild-Text-Paaren.

Nach dem Pretraining nutzt man sprachliche Klassenbeschreibungen (Prompt-Templates) als Text-Prototypen im gemeinsamen Raum; die Zero-shot-Klassifikation erfolgt per Nearest-Neighbor (z. B. maximale Kosinus-Ähnlichkeit) zwischen Bild-Embedding und den Text-Embeddings der Klassenbeschreibungen. Die gleiche Einbettung ermöglicht Image↔Text-Retrieval.

Abgrenzung & Varianten: Neben CLIP gibt es konzeptionell ähnliche Dual-Encoder (z. B. ALIGN) sowie Abwandlungen (LiT, SigLIP, OpenCLIP). Andere Architekturen koppeln Vision-Encoder mit generativen Decodern oder LLMs (z. B. BLIP/BLIP-2, Flamingo, PaLI, LLaVA, Kosmos-1).


Beispiele multimodaler Architekturen (Auswahl)

  • ALIGN (Google, 2021): Dual-Encoder auf sehr großen Web-Bild-Text-Paaren („noisy alt-text“); starke Zero-shot-/Retrieval-Leistungen.
  • LiT – Locked-image Text Tuning (Google, 2021/22): Bild-Encoder eingefroren, nur der Text-Zweig wird kontrastiv angepasst; sehr starke Zero-shot-Transfers.
  • SigLIP (Google, 2023): Sigmoid-Loss statt Softmax-Kontrastiv; robusteres Skalieren und teils bessere Zero-shot-Ergebnisse.
  • OpenCLIP / LAION (2022): Open-Source-Reproduktion und Skalierungs-Studien mit großen offenen Datensätzen (LAION-400M/2B/5B).
  • BLIP (Salesforce, 2022): Encoder-Decoder; nutzt gebootstrappte Captions; deckt Understanding & Generation ab.
  • BLIP-2 (2023): Gefrorene Bild-Encoder + LLM, verbunden per Q-Former; starke Zero-shot-VQA bei viel weniger trainierbaren Parametern.
  • Flamingo (DeepMind, 2022): VLM mit Cross-Attention auf visuelle Features + starker LLM-Backbone; Few-shot in multimodalen Aufgaben.
  • PaLI / PaLI-X (Google, 2022/23): Skalierte Vision-/Sprach-Komponenten, multilingual, breite Aufgabenabdeckung (Captioning, VQA, OCR-frei u. a.).
  • LLaVA (2023): Vision-Encoder + LLM mit Visual Instruction Tuning; offene Modelle, stark in multimodalen Chats.
  • Kosmos-1 (Microsoft, 2023): Multimodales LLM; kann Instruktionen folgen, in-context lernen und Zero-shot ausführen.

Verwandte Begriffe:
Embedding/Vektorraum ·
Retrieval-Augmented Generation (RAG) / Hybride KI ·
Prompt ·
Zero-shot


Quellen (externe Belege; kopierbare, klickbare Links)

CLIP (OpenAI)
Blog (Jan 2021): https://openai.com/index/clip/
Paper (arXiv): https://arxiv.org/abs/2103.00020  |
PDF: https://arxiv.org/pdf/2103.00020
Paper (PMLR): https://proceedings.mlr.press/v139/radford21a/radford21a.pdf

ALIGN
Google-Research-Blog: https://research.google/blog/align-scaling-up-visual-and-vision-language-representation-learning-with-noisy-text-supervision/
Paper (arXiv): https://arxiv.org/abs/2102.05918  |
PDF (PMLR ICML 2021): https://proceedings.mlr.press/v139/jia21b/jia21b.pdf

LiT – Locked-image Text Tuning
Paper (arXiv): https://arxiv.org/abs/2111.07991  |
PDF (CVPR 2022): https://openaccess.thecvf.com/content/CVPR2022/papers/Zhai_LiT_Zero-Shot_Transfer_With_Locked-Image_Text_Tuning_CVPR_2022_paper.pdf
Google-Research-Blog: https://research.google/blog/locked-image-tuning-adding-language-understanding-to-image-models/

SigLIP
Paper (arXiv): https://arxiv.org/abs/2303.15343  |
PDF (ICCV 2023): https://openaccess.thecvf.com/content/ICCV2023/papers/Zhai_Sigmoid_Loss_for_Language_Image_Pre-Training_ICCV_2023_paper.pdf

OpenCLIP / LAION
Paper (arXiv): https://arxiv.org/abs/2212.07143  |
PDF: https://arxiv.org/pdf/2212.07143
LAION Blog: https://laion.ai/blog/large-openclip/
Repo (OpenCLIP): https://github.com/mlfoundations/open_clip

BLIP / BLIP-2
BLIP (arXiv): https://arxiv.org/abs/2201.12086  |
PDF (PMLR 2022): https://proceedings.mlr.press/v162/li22n/li22n.pdf
BLIP-2 (arXiv): https://arxiv.org/abs/2301.12597

Flamingo
Paper (arXiv): https://arxiv.org/abs/2204.14198  |
PDF (NeurIPS 2022): https://proceedings.neurips.cc/paper_files/paper/2022/file/960a172bc7fbf0177ccccbb411a7d800-Paper-Conference.pdf

PaLI / PaLI-X
PaLI (arXiv): https://arxiv.org/abs/2209.06794  |
PDF: https://arxiv.org/pdf/2209.06794
PaLI-X (arXiv): https://arxiv.org/pdf/2305.18565

LLaVA
Paper (arXiv): https://arxiv.org/abs/2304.08485  |
PDF: https://arxiv.org/pdf/2304.08485  |
Projektseite: https://llava-vl.github.io/

Kosmos-1
Paper (arXiv): https://arxiv.org/abs/2302.14045  |
PDF: https://arxiv.org/pdf/2302.14045