Einfach erklärt
LAION ist eine sehr große Sammlung von Bild‑Text‑Paaren aus dem Web (für KI‑Forschung/Bildmodelle). Weil Milliarden Bilder zu viel auf einmal sind, stellt LAION „Teilmengen“ (Subsets) bereit – kleinere, gefilterte Ausschnitte für bestimmte Zwecke. Für praktische Einstiege und Übungen siehe den Kurs‑ & Schulungs‑Hub.
Beispiele für Teilmengen:
- LAION‑400M: ca. 400 Mio. Bild‑Text‑Paare, CLIP‑gefiltert – erster großer, offen zugänglicher Datensatz (2021).
- LAION‑5B: ca. 5,85 Mrd. Paare (davon ~2,32 Mrd. Englisch). Grundlage für viele offene Bild‑/Text‑Modelle.
- LAION‑Aesthetics/Aesthetics V2: aus LAION‑5B gefiltert nach „ästhetischer“ Score (und z. B. Wasserzeichen/NSFW‑Filtern) – oft genutzt für Bildgenerierung.
- LAION‑2B(en): englischsprachige Teilmenge (~2 Mrd.), Subsets davon wurden z. B. für Stable Diffusion v1 verwendet.
- LAION‑5B‑High‑Res / domänenspezifische Subsets (z. B. LAION‑EO für Erdbeobachtung): thematisch/qualitativ gezielte Ausschnitte.
Professionelle Definition
LAION‑Teilmengen sind abgeleitete, kuratierte oder gefilterte Unterdatensätze der LAION‑Korpora (u. a. LAION‑400M, LAION‑5B). Sie werden mittels CLIP‑basierter Filterung, Qualitäts‑/Aesthetics‑Scores (z. B. Aesthetics V2) und Sicherheits‑Signalen (z. B. Wasserzeichen/NSFW‑Wahrscheinlichkeiten) erzeugt, um spezifische Trainings‑/Evaluationsziele (z. B. Text‑zu‑Bild, Domänenfokus, hohe Auflösung) zu unterstützen. Für die betriebliche Umsetzung (Pipelines, Qualität, Rechte) helfen KI‑Workflows & Automatisierung und Datenschutz & Compliance.
Dokumentierte Beispiele: LAION‑400M (2021) als 400 M Paar‑Baseline, LAION‑5B (2022) mit 5.85 B Paaren, Aesthetics‑Teilmengen (≥ Score‑Schwellen), LAION‑2B(en) für englische Beschreibungen (u. a. für Stable Diffusion v1 genutzt), sowie domänenspezifische Ableger wie LAION‑EO (Erdbeobachtung) aus LAION‑5B. Hinweis (Datenethik): Audits zeigen Risiken (z. B. problematische Inhalte/Privatdaten); LAION berichtet Entfernungen/Filter‑Verbesserungen. Nutzer sollten rechtliche/ethische Vorgaben beachten.
Quellen
- LAION‑5B (Paper, 2022 – 5.85 B Paare)
https://arxiv.org/abs/2210.08402 - LAION‑400M (Paper, 2021 – 400 M Paare)
https://arxiv.org/abs/2111.02114 - LAION – Datasets/Teilmengen (Übersicht inkl. Aesthetics/Aesthetics V2)
https://projects.laion.ai/laion-datasets/
https://laion.ai/blog/laion-aesthetics/ - Stable Diffusion v1 (Model‑Card: „trained on subsets of LAION‑2B(en)“)
https://huggingface.co/CompVis/stable-diffusion-v1-4 - Domänen‑Subset Beispiel – LAION‑EO (aus LAION‑5B extrahiert)
https://arxiv.org/abs/2309.15535 - Audit/Medienberichte zu Inhalts‑Risiken (Auswahl)
https://www.theguardian.com/technology/2023/dec/20/ai-image-generators-child-sexual-abuse
https://www.wired.com/story/ai-tools-are-secretly-training-on-real-childrens-faces