Einfach erklärt
Zero‑shot heißt: Ein Modell löst eine neue Aufgabe, ohne dafür ein einziges passendes Beispiel gesehen zu haben. Es nutzt allgemeines Wissen und Beschreibungen.
Ganz einfache Beispiele:
• Tier nach Beschreibung erkennen: „Okapi: braun, Beine mit weißen Ringeln“ – das Modell findet Okapis, obwohl es keine Okapi‑Fotos im Training hatte.
• Neues Verkehrszeichen: Eine kurze Beschreibung reicht, damit das System das neue Zeichen richtig zuordnet.
• Textaufgabe: Nur mit einer klaren Anweisung (ohne Beispiele) löst das Modell die Aufgabe.
Professionelle Definition
Zero‑shot‑Lernen bezeichnet Verfahren, die auf ungesehene Klassen/Aufgaben generalisieren, indem sie eine semantische Brücke nutzen (z. B. Attribute, Textbeschreibungen, Wort‑Einbettungen). In der Bildklassifikation projiziert ein Encoder ein Bild x in einen Merzraum und vergleicht es mit Repräsentationen a_c ungesehener Klassen; die Vorhersage ist das c mit der höchsten Ähnlichkeit. Moderne Ansätze (z. B. CLIP) lernen gemeinsame Bild‑/Text‑Räume und ordnen Bilder zero‑shot den Textlabels zu.
Quellen
• Xian et al. (2017) – Zero‑Shot Learning: The Good, the Bad and the Ugly (CVPR, Evaluierung/Definition)
https://arxiv.org/abs/1703.04394
https://openaccess.thecvf.com/content_cvpr_2017/papers/Xian_Zero-Shot_Learning_-_CVPR_2017_paper.pdf
• Radford et al. (2021) – CLIP: Learning Transferable Visual Models From Natural Language Supervision (Zero‑shot Bildklassifikation)
https://arxiv.org/abs/2103.00020
• IBM – What is Zero‑Shot Learning? (Einführung)
https://www.ibm.com/think/topics/zero-shot-learning
• DataCamp – Zero‑Shot Learning: A Guide With Examples (Alltagsnahe Übersicht)
https://www.datacamp.com/blog/zero-shot-learning