Einfach erklärt
(PCA, t‑SNE, UMAP) Dimensionsreduktion wandelt hochdimensionale Daten in wenige aussagekräftige Merkmale um. Ziel: Struktur sichtbar machen, Rauschen entfernen und Rechnen beschleunigen – ideal für Visualisierung, Vorverarbeitung und Clustering/Klassifikation.
Ganz einfache Beispiele:
• Bilder → wenige Komponenten: Aus tausenden Pixeln werden wenige „Hauptkomponenten“, die Helligkeit/Kanten/Muster beschreiben.
• Kundenmerkmale komprimieren: Ähnliche Verhaltensmuster liegen nach der Reduktion näher zusammen → einfachere Segmentierung.
• 2D‑Plot: Hochdimensionale Punktwolken lassen sich in 2D projizieren, um Cluster zu erkennen.
Professionelle Definition
Gegeben Datenmatrix X ∈ ℝ^{n×d} mit zentrierten Zeilen x_i. Dimensionsreduktion sucht eine Abbildung f: ℝ^d → ℝ^m (m ≪ d), die wesentliche Struktur erhält (Varianz, Nachbarschaften, Mannigfaltigkeitsgeometrie) und Informationsverlust minimiert.
PCA (Principal Component Analysis): Findet eine lineare Projektion auf orthogonale Richtungen maximierter Varianz. Mit Kovarianz Σ = (1/(n−1)) XᵀX liefert die Eigenzerlegung Σ = VΛVᵀ die Hauptkomponenten (Spalten von V). Projektion: Z = X V_m. Äquivalent zur SVD: X = U S Vᵀ; wähle die ersten m Spalten von V.
t‑SNE (t‑Distributed Stochastic Neighbor Embedding): Nichtlinear. Modelliert Nachbarschaftswahrscheinlichkeiten p_{ij} in hoher Dimension und q_{ij} in niedriger Dimension (Cauchy‑/t‑Kernel) und minimiert KL‑Divergenz KL(P‖Q). Erhält lokale Struktur, kann Cluster sichtbar machen; skaliert schlechter, keine globalen Distanzen interpretieren, hyperparameter‑sensitiv (Perplexity, Lernrate, Iterationen).
UMAP (Uniform Manifold Approximation and Projection): Baut einen gewichteten Nachbarschaftsgraphen (fuzzy simplicial set) aus k‑NN in hoher Dimension, optimiert eine kreuzentropieartige Zielfunktion, um diesen Graphen in niedriger Dimension zu erhalten. Erhält lokale und teilweise globale Struktur, ist oft schneller als t‑SNE; wichtige Parameter: n_neighbors, min_dist, metric.
Einsatz & Praxis: Visualisierung (2D/3D), Preprocessing vor Clustering/Klassifikation, Rauschen reduzieren, Überanpassung mindern. Standardisiere Features für PCA, prüfe Erklärte Varianz (Scree/Elbow), nutze k‑NN‑Indices für große Daten (UMAP/t‑SNE), setze Random‑Seed für Reproduzierbarkeit.
Quellen
- Pearson (1901) – On lines and planes of closest fit to systems of points in space
https://www.jstor.org/stable/2331912 - Hotelling (1933) – Analysis of a complex of statistical variables into principal components
https://www.jstor.org/stable/2277762 - van der Maaten & Hinton (2008) – Visualizing Data using t‑SNE (JMLR)
https://www.jmlr.org/papers/v9/vandermaaten08a.html - McInnes, Healy, Melville (2018) – UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction
https://arxiv.org/abs/1802.03426 - scikit‑learn – User Guide: PCA, t‑SNE, UMAP (API/Beispiele)
https://scikit-learn.org/stable/modules/decomposition.html
https://scikit-learn.org/stable/modules/manifold.html#t-sne
https://umap-learn.readthedocs.io