Einfach erklärt

Zero‑shot heißt: Ein Modell löst eine neue Aufgabe, ohne dafür ein einziges passendes Beispiel gesehen zu haben. Es nutzt allgemeines Wissen und Beschreibungen.

Ganz einfache Beispiele:

• Tier nach Beschreibung erkennen: „Okapi: braun, Beine mit weißen Ringeln“ – das Modell findet Okapis, obwohl es keine Okapi‑Fotos im Training hatte.
• Neues Verkehrszeichen: Eine kurze Beschreibung reicht, damit das System das neue Zeichen richtig zuordnet.
• Textaufgabe: Nur mit einer klaren Anweisung (ohne Beispiele) löst das Modell die Aufgabe.

Professionelle Definition

Zero‑shot‑Lernen bezeichnet Verfahren, die auf ungesehene Klassen/Aufgaben generalisieren, indem sie eine semantische Brücke nutzen (z. B. Attribute, Textbeschreibungen, Wort‑Einbettungen). In der Bildklassifikation projiziert ein Encoder ein Bild x in einen Merzraum und vergleicht es mit Repräsentationen a_c ungesehener Klassen; die Vorhersage ist das c mit der höchsten Ähnlichkeit. Moderne Ansätze (z. B. CLIP) lernen gemeinsame Bild‑/Text‑Räume und ordnen Bilder zero‑shot den Textlabels zu.

Quellen

• Xian et al. (2017) – Zero‑Shot Learning: The Good, the Bad and the Ugly (CVPR, Evaluierung/Definition)
https://arxiv.org/abs/1703.04394
https://openaccess.thecvf.com/content_cvpr_2017/papers/Xian_Zero-Shot_Learning_-_CVPR_2017_paper.pdf

• Radford et al. (2021) – CLIP: Learning Transferable Visual Models From Natural Language Supervision (Zero‑shot Bildklassifikation)
https://arxiv.org/abs/2103.00020

• IBM – What is Zero‑Shot Learning? (Einführung)
https://www.ibm.com/think/topics/zero-shot-learning

• DataCamp – Zero‑Shot Learning: A Guide With Examples (Alltagsnahe Übersicht)
https://www.datacamp.com/blog/zero-shot-learning