Einfach erklärt
(z. B. K-Means, DBSCAN)Clustering ordnet ähnliche Datenpunkte zu Gruppen (Clustern) – ohne vorgegebene Labels. Punkte, die sich ähneln, landen zusammen; unähnliche Punkte werden getrennt. So erkennt man Muster, kann segmentieren, suchen oder Anomalien finden.
Ganz einfache Beispiele:
• Kunden: Käufer mit ähnlichem Verhalten bilden ein Segment → gezieltere Kampagnen.
• Bilder: Fotos mit ähnlicher Textur/Farbe/Motiv landen im selben Cluster.
• Ausreißer: Punkte, die zu keiner Gruppe gehören, sind potenzielle Anomalien.
Professionelle Definition
Gegeben eine Punktmenge X = {x1, …, xn} in R^d zielt Clustering darauf ab, Struktur als Gruppierung C1, …, Ck oder als dichte Regionen zu erfassen, sodass Intra-Cluster-Ähnlichkeit hoch und Inter-Cluster-Ähnlichkeit niedrig ist. Übliche Distanz- bzw. Ähnlichkeitsmaße sind euklidische Distanz und Kosinus-Distanz (insbesondere bei Einbettungen).
K-Means (partitionsbasiert): Minimiert die Summe der quadratischen Abstände der Punkte zu ihren Cluster-Zentren (Centroids). Eigenschaften: schnell, skaliert gut, benötigt k, nimmt eher konvexe/kugelige Cluster an; empfindlich gegenüber Ausreißern und Skalierung. Varianten: k-means++ (bessere Initialisierung), Mini-Batch.
DBSCAN (dichtebasiert): Punkte mit mindestens minPts Nachbarn in einem epsilon-Radius bilden dichte Cluster; Punkte ohne Dichte gelten als Rauschen. Eigenschaften: erkennt beliebige Formen, keine k-Angabe, findet Ausreißer; sensibel für die Wahl von epsilon. Verwandt: HDBSCAN (hierarchisch, robuster Parameterwahl, liefert Stabilitäten).
Modellwahl und Gütemaße: Elbow-Methode und Gap-Statistic (Heuristiken für k), Silhouette-Koeffizient s = (b – a) / max(a, b) mit a = durchschnittliche Intra-Cluster-Distanz und b = minimale durchschnittliche Distanz zum Nachbar-Cluster; weitere interne Maße: Davies–Bouldin, Calinski–Harabasz; externe Maße (falls Labels vorhanden): ARI, NMI, F1.
Praxis: Skalierung/Normalisierung (z. B. Standardisierung, L2), Dimensionsreduktion (PCA, UMAP) bei hohen Dimensionen, mehrere Läufe/Seeds (K-Means), Parameter-Sweep für epsilon und minPts (DBSCAN), Metrik an Daten anpassen.
Quellen
- Wikipedia – Clusteranalyse (Grundidee, Verfahren)
https://de.wikipedia.org/wiki/Clusteranalyse - Lloyd (1982) – Least Squares Quantization in PCM (K‑Means)
https://doi.org/10.1109/TIT.1982.1056489 - Arthur & Vassilvitskii (2007) – k‑means++: The Advantages of Careful Seeding
https://theory.stanford.edu/~sergei/papers/kMeansPP-soda.pdf - Ester, Kriegel, Sander, Xu (1996) – A Density‑Based Algorithm for Discovering Clusters in Large Spatial Databases with Noise (DBSCAN)
https://www.dbs.ifi.lmu.de/Publikationen/Papers/KDD-96.final.frame.pdf - Jain, Murty, Flynn (1999) – Data Clustering: A Review (Übersicht)
https://doi.org/10.1145/331499.331504