Innere Darstellungen eines Modells
Einfach erklärt
Latent Space / Latente Repräsentationen Eine latente Repräsentation ist eine versteckte Zahlenbeschreibung (Vektor) eines Datenpunkts, die ein Modell intern verwendet. Statt jedes Pixel/Word zu speichern, komprimiert das Modell die wesentlichen Faktoren (z. B. Form, Stil, Pose) in wenigen Merkmalen im Latentraum. In diesem Raum liegen ähnliche Inhalte nahe beieinander; kleine Änderungen im Latentraum führen zu sinnvollen Varianten im Originalraum.
Ganz einfache Beispiele:
• Gesichter: Ein Latentvektor kodiert z. B. Lächeln, Beleuchtung, Blickrichtung. Einen „Lächeln‑Regler“ hochdrehen → das Gesicht lächelt stärker.
• Ziffern (MNIST): Nähe im Latentraum entspricht ähnlicher Form (runde vs. eckige Ziffern).
• Musik/Audio: Latente Faktoren wie Tempo oder Timbre erlauben Variationen desselben Motivs.
Professionelle Definition
Gegeben einen Eingaberaum (\mathcal X) und einen Encoder (f_\phi: \mathcal X \to \mathcal Z) in einen Latentraum (\mathcal Z = \mathbb R^d), sowie (optional) einen Decoder (g_\theta: \mathcal Z \to \mathcal X). Eine latente Repräsentation ist der Vektor (z = f_\phi(x)), der die erklärenden Faktoren der Variation in (x) verdichtet. Ziel ist, dass (z) informativ für Aufgaben (Klassifikation, Generierung) und glatt/kontinuierlich in Bezug auf Datenmanifolds ist.
Eigenschaften & Konzepte:
• Manifold‑Hypothese: Daten liegen näherungsweise auf einer niedrigdimensionalen Mannigfaltigkeit in (\mathbb R^D); (f) lernt eine Koordinatisierung davon.
• Disentanglement: Komponenten von (z) korrespondieren (möglichst) zu getrennten Faktoren (z. B. Position, Stil).
• Identifizierbarkeit: Ohne Supervision ist Disentanglement i. A. nicht eindeutig (Nicht‑Identifizierbarkeit).
• Lineare Separierbarkeit/Linear Probes: Gute Repräsentationen erlauben einfache Modelle (linear) für Downstream‑Aufgaben.
• Information Bottleneck: (z) soll maximal informativ über Zielvariable Y, aber minimal über irrelevantes Rauschen sein.
Methoden (Beispiele):
• Autoencoder/VAE: Optimieren Rekonstruktionsziel (VAE zusätzlich KL‑Regularisierung) → kontinuierlicher Latentraum.
• Kontrastives Lernen (InfoNCE, SimCLR): Bringt Gleiches zusammen, Ungleiches auseinander → semantisch strukturierter (\mathcal Z).
• Disentangled Learning: β‑VAE, FactorVAE, InfoGAN fördern faktorisierte Latenten.
• Latente Diffusion: Diffusion im komprimierten Latentraum für effiziente Generierung.
Einsatz: Semantische Suche, Clustering, Transfer‑/Few‑Shot‑Lernen, Generierung/Editing (Interpolation in (\mathcal Z)), Anomalie‑Erkennung, Empfehlungen.
Quellen
- Wikipedia – Latente Variable (Grundidee latenter Faktoren)
https://de.wikipedia.org/wiki/Latente_Variable - Wikipedia – Representation learning (Überblick, Motivation)
https://en.wikipedia.org/wiki/Representation_learning - Bengio, Courville, Vincent (2013) – Representation Learning: A Review and New Perspectives
https://arxiv.org/abs/1206.5538 - Kingma & Welling (2014) – Auto‑Encoding Variational Bayes (VAE)
https://arxiv.org/abs/1312.6114 - Higgins et al. (2017) – β‑VAE: Learning Basic Visual Concepts with a Constrained Variational Framework
https://openreview.net/forum?id=Sy2fzU9gl - Locatello et al. (2019) – Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations
https://arxiv.org/abs/1811.12359 - Chen et al. (2016) – InfoGAN: Interpretable Representation Learning by Information Maximizing GANs
https://arxiv.org/abs/1606.03657 - Tishby, Pereira, Bialek (1999) – The Information Bottleneck Method
https://arxiv.org/abs/physics/0004057