Einfach erklärt
Eine Einbettung ist eine Zahlendarstellung (Vektor) für Dinge wie Wörter, Sätze, Bilder oder Produkte. Ähnliche Dinge bekommen ähnliche Zahlen. So kann ein Computer Ähnlichkeit messen, suchen, clustern oder empfehlen.
Ganz einfache Beispiele:
• Wörter: „König“ und „Königin“ liegen nah beieinander; „König – Mann + Frau ≈ Königin“.
• Suche: Ein Satz und eine passende Antwort haben ähnliche Vektoren → die Antwort wird gefunden.
• Bilder: Zwei Fotos vom gleichen Objekt haben ähnliche Einbettungen, auch wenn Licht/Ansicht anders ist.
• Empfehlungen: Produkte, die häufig zusammen gekauft werden, liegen nah beieinander.
Professionelle Definition
Eine Einbettung ist eine Abbildung (f: \mathcal{X} \to \mathbb{R}^d), die Elemente (x) aus einem Eingaberaum in einen d‑dimensionalen Vektorraum abbildet, so dass semantische Beziehungen als Geometrie (Abstände/Winkel) erfasst werden. Übliche Ähnlichkeitsmaße sind Kosinus‑Ähnlichkeit und euklidische Distanz.
Trainingsprinzipien (Beispiele):
• Wort‑Einbettungen: Skip‑Gram/CBOW (word2vec) und GloVe lernen Vektoren aus Ko‑Vorkommen in Texten.
• Kontextuelle Einbettungen: BERT‑ähnliche Modelle liefern satz‑/kontextabhängige Vektoren.
• Kontrastives/Metrik‑Lernen: Paare/Tripel (ähnlich vs. unähnlich) mit Triplet‑Loss oder InfoNCE; CLIP lernt Bild‑/Text‑Vektoren im gemeinsamen Raum.
Einsatz: Semantische Suche, Ähnlichkeitssuche (k‑NN/ANN), Clustering, Klassifikation (auf Einbettungen), Empfehlungen, Deduplication, Out‑of‑Distribution‑Erkennung. Praxishinweise: Normalisierung (z. B. L2), Dimensionalität/Speicher, Drift überwachen.
Quellen
- Wikipedia – Word embedding (Grundidee, Beispiele, Semantik als Geometrie)
https://en.wikipedia.org/wiki/Word_embedding - Mikolov et al. (2013) – Efficient Estimation of Word Representations in Vector Space (word2vec)
https://arxiv.org/abs/1301.3781 - Pennington, Socher, Manning (2014) – GloVe: Global Vectors for Word Representation
https://nlp.stanford.edu/pubs/glove.pdf - Devlin et al. (2019) – BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding (kontextuelle Einbettungen)
https://arxiv.org/abs/1810.04805 - Radford et al. (2021) – CLIP: Learning Transferable Visual Models From Natural Language Supervision (gemeinsamer Bild‑/Text‑Raum)
https://arxiv.org/abs/2103.00020