6 A B C D E F G H I K L M N O P Q R S T U V W Z

Einfach erklärt

Diffusionsmodelle erzeugen neue Daten (z. B. Bilder, Audio, Text‑Konditionierungen), indem sie mit rein zufälligem Rauschen starten und dieses schrittweise entrauschen.
Die Idee: Im Vorwärtsprozess wird zu echten Daten schrittweise Rauschen addiert, bis nur noch Zufall bleibt. Im Rückwärtsprozess lernt ein neuronales Netz, das Rauschen Schritt für Schritt zu entfernen – so entstehen realistische Samples.

Ganz einfache Beispiele:

Bildgenerierung: Starte mit reinem Rauschen → nach vielen Entrausch‑Schritten entsteht ein fotorealistisches Bild.
Text‑zu‑Bild (Prompting): Konditioniere auf einen Textprompt (Guidance) → das Entrauschen folgt deiner Beschreibung.
Bildreparatur/‑bearbeitung: Teile eines Bildes werden neu gesampelt (Inpainting/Outpainting), ohne Stilbruch.

Professionelle Definition

Ein (diskretes) DDPM (Denoising Diffusion Probabilistic Model) definiert einen Vorwärts‑Noising‑Prozess (q) und einen gelernten Rückwärtsprozess (p_\theta):

Vorwärtsprozess (Markov‑Kette): Für eine Rauschskala ({\beta_t}{t=1}^T), (\alpha_t = 1-\beta_t), (\bar\alpha_t=\prod{s=1}^t \alpha_s):
[ q(x_t\mid x_{t-1}) = \mathcal N\big(x_t; \sqrt{\alpha_t},x_{t-1},, (1-\alpha_t)I\big),\qquad q(x_t\mid x_0)=\mathcal N\big(x_t; \sqrt{\bar\alpha_t},x_0,,(1-\bar\alpha_t)I\big). ]

Rückwärtsprozess / Parameterisierung:
Lerne (p_\theta(x_{t-1}\mid x_t) = \mathcal N\big(x_{t-1}; \mu_\theta(x_t,t),,\Sigma_\theta(x_t,t)\big)). Praktisch wird (\mu_\theta) über eine Rauschschätzung (\varepsilon_\theta(x_t,t)) parameterisiert. Die gängige Loss (bis auf Konstanten) ist:
[ \mathcal L_{\text{simple}} = \mathbb E_{t,,x_0,,\varepsilon\sim\mathcal N(0,I)}\big[,\lVert \varepsilon – \varepsilon_\theta(x_t,t)\rVert_2^2,\big],\quad x_t = \sqrt{\bar\alpha_t},x_0 + \sqrt{1-\bar\alpha_t},\varepsilon. ]

Score‑basierte / SDE‑Sicht: Kontinuierliche Varianten modellieren Scores (\nabla_x \log p_t(x)) und lösen stochastische Differentialgleichungen (z. B. VP/VE‑SDE). Sampler: Predictor–Corrector, ODE‑Samplers.

Guidance & Konditionierung:
Classifier‑Guidance bzw. Classifier‑free Guidance (CFG) steuern die Generierung über Bedingungen (Text, Klassen, Bilder) und verbessern Fidelity vs. Diversity.
Latente Diffusion (LDM) wendet die Diffusion im komprimierten Latentraum an → schneller und speichereffizient (z. B. Stable Diffusion).

Einsatz & Praxis: Text‑zu‑Bild, Inpainting/Outpainting, Super‑Resolution, Audio‑/Video‑Synthese, Bild‑zu‑Bild‑Stylisierung. Tipps: Rauschplan ((\beta_t)) und Sampler beeinflussen Qualität/Geschwindigkeit; CFG‑Skala balanciert Übereinstimmung mit Kondition vs. Vielfalt; FP16/Quantisierung spart Speicher; Latentraum beschleunigt deutlich.

Quellen

  1. Sohl‑Dickstein et al. (2015) – Deep Unsupervised Learning using Nonequilibrium Thermodynamics
    https://arxiv.org/abs/1503.03585
  2. Ho, Jain, Abbeel (2020) – Denoising Diffusion Probabilistic Models
    https://arxiv.org/abs/2006.11239
  3. Nichol & Dhariwal (2021) – Improved Denoising Diffusion Probabilistic Models
    https://arxiv.org/abs/2102.09672
  4. Dhariwal & Nichol (2021) – Diffusion Models Beat GANs on Image Synthesis
    https://arxiv.org/abs/2105.05233
  5. Song et al. (2021) – Score‑Based Generative Modeling through Stochastic Differential Equations
    https://arxiv.org/abs/2011.13456
  6. Rombach et al. (2022) – High‑Resolution Image Synthesis with Latent Diffusion Models
    https://arxiv.org/abs/2112.10752