Einfach erklärt
Stable Diffusion ist eine KI, die aus Text Bilder macht. Du schreibst eine Beschreibung (Prompt), und das Programm baut daraus ein Bild. Es kann auch vorhandene Bilder verändern:
- Text‑zu‑Bild: „Ein roter Fuchs im Nebelwald“ → fertiges Bild.
- Bild‑zu‑Bild: Ein Foto als Vorlage nehmen und Stil/Details anpassen.
- Bereiche ersetzen/erweitern (Inpainting/Outpainting): Einen Teil im Bild übermalen/ergänzen (z. B. Himmel austauschen, Rand erweitern).
Viele nutzen SDXL (neuere Version) für höhere Bildqualität.
Professionelle Definition
Stable Diffusion ist ein textkonditioniertes latentes Diffusionsmodell (LDM) auf Basis von Rombach et al., 2022. Statt im Pixelraum wird die Rausch‑Entfernung im komprimierten latenten Raum eines Autoencoders durchgeführt; Cross‑Attention verbindet Text‑Einbettungen (z. B. CLIP‑Textencoder) mit der Bildsynthese. Die v1‑Reihe (2022) wurde von CompVis/Stability/Runway auf LAION‑Teilmengen trainiert und unter CreativeML Open RAIL‑M (nutzungsbeschränkt, aber offen zugänglich) veröffentlicht. Danach folgten v2 (2022) und SDXL 1.0 (2023) als offenes Modell mit verbesserter Bildtreue; spätere Reihen (SD 3/3.5) erweitern die Modellfamilie.
Quellen
- Wikipedia (de) – Stable Diffusion (Überblick, Trainingsdaten LAION, Versionshistorie):
https://de.wikipedia.org/wiki/Stable_Diffusion - Paper – Latent Diffusion Models (CVPR 2022 / arXiv 2021):
https://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf
https://arxiv.org/abs/2112.10752 - Model Card – CompVis/stable‑diffusion‑v1‑4 (Hugging Face):
https://huggingface.co/CompVis/stable-diffusion-v1-4 - Lizenz – CreativeML Open RAIL‑M:
https://huggingface.co/spaces/CompVis/stable-diffusion-license/raw/main/license.txt - Stability AI – SDXL 1.0 Ankündigung:
https://stability.ai/news/stable-diffusion-sdxl-1-announcement
Weiterführende Informationen KI Kurse wie man Bilder erstellt