Einfach erklärt
Variational Autoencoder (VAE) Ein Variational Autoencoder ist ein Generationsmodell, das Daten (z. B. Bilder, Texte, Audiosignale) in einen kompakten, kontinuierlichen Latentraum kodiert und daraus wieder realistische Beispiele erzeugt.
Die Idee: komprimieren (Encoder) → stochastischer Latentvektor → rekonstruieren (Decoder). Dabei wird der Latentraum so gelernt, dass ähnliche Daten nahe beieinander liegen und man sinnvoll interpolieren und variieren kann.
Ganz einfache Beispiele:
• Bild‑Interpolation: Zwei Ziffern (3 → 8) im Latentraum linear mischen → Zwischenbilder entstehen „stufenlos“.
• Denoising/Variation: Ein Bild leicht verändern (Sampling im Latentraum) → natürlich wirkende Varianten desselben Objekts.
• Anomalie‑Erkennung: VAE rekonstruiert „typische“ Muster gut; stark fehlerhafte Rekonstruktion deutet auf Ausreißer hin.
Professionelle Definition
Der VAE definiert ein generatives Modell (p_\theta(x,z) = p_\theta(x\mid z),p(z)) mit einfachem Prior (p(z)=\mathcal N(0,I)) und einer Approximationsverteilung (Encoder) (q_\phi(z\mid x)) für die inferenzschwere Posteriorverteilung (p_\theta(z\mid x)). Optimiert wird die ELBO (Evidence Lower BOund):
[
\log p_\theta(x) \ge \mathbb E_{q_\phi(z\mid x)}[\log p_\theta(x\mid z)]; -; \mathrm{KL}\big(q_\phi(z\mid x);\Vert;p(z)\big).
]
• Rekonstruktions‑Term maximiert die Datenlikelihood (z. B. Bernoulli/Gauss im Decoder).
• Regularisierung: KL‑Divergenz drückt (q_\phi(z\mid x)) in Richtung des Priors, fördert glatten Latentraum.
Reparameterization‑Trick:
Zur stochastischen Ableitung wird gesampelt über (z = \mu_\phi(x) + \sigma_\phi(x) \odot \varepsilon), (\varepsilon\sim\mathcal N(0,I)); so fließt der Gradient durch (\mu,\sigma).
Varianten (Beispiele):
• β‑VAE: Gewichtung des KL‑Terms mit (\beta>1) → stärker disentanglete Faktoren, teils schlechtere Rekonstruktion.
• CVAE (Conditional VAE): Bedingungen (y) (Labels, Attribute) werden Encoder/Decoder zugeführt → gesteuerte Generierung.
• VQ‑VAE: Diskreter Latentraum via Vektorquantisierung (nützlich für Audio/Bild), ersetzt Gauss‑Latents durch Codebook.
Einsatz: Bild/Audio/Text‑Generierung, Datenkompression, Feature‑Lernen, Anomalie‑Detektion, Imputation fehlender Werte, Simulation. Praxis: Normalisierung, passende Decoder‑Likelihood (Bernoulli vs. Gaussian), Kapazitätssteuerung (β‑VAE, KL‑Annealing), ausreichende Latentdimension, Frühes Stoppen zur Stabilität.
Quellen
- Kingma & Welling (2014) – Auto-Encoding Variational Bayes
https://arxiv.org/abs/1312.6114 - Rezende, Mohamed, Wierstra (2014) – Stochastic Backpropagation and Approximate Inference in Deep Generative Models
https://arxiv.org/abs/1401.4082 - Higgins et al. (2017) – β‑VAE: Learning Basic Visual Concepts with a Constrained Variational Framework
https://openreview.net/forum?id=Sy2fzU9gl - Sohn, Lee, Yan (2015) – Learning Structured Output Representation using Deep Conditional Generative Models (CVAE)
https://arxiv.org/abs/1506.05517 - van den Oord, Vinyals, Kavukcuoglu (2017) – Neural Discrete Representation Learning (VQ‑VAE)
https://arxiv.org/abs/1711.00937