Einfach erklärt
Stellschrauben, die das Lernen steuern. Hyperparameter sind Einstellungen, die du vor oder rund um das Training festlegst. Sie bestimmen wie ein Modell lernt (Tempo, Stärke der Regulierung, Größe des Modells), nicht was es lernt. Die Parameter (Gewichte) lernt das Modell selbst; die Hyperparameter stellst du ein.
Beispiele: Lernrate, Batch‑Größe, Anzahl Schichten/Neuronen, Dropout‑Rate, Regularisierung, Vokabulargröße beim Tokenizer.
Kurz: Gewichte werden gelernt → Hyperparameter werden gewählt → gutes Generalisieren statt Auswendiglernen.
Ganz einfache Beispiele
• Backofen: Temperatur und Backzeit bestimmst du. Der Kuchen „lernt“ dadurch wie schnell er garen soll. Zu heiß/zu lang → überbacken, zu kalt/zu kurz → nicht durch.
• Fahrradschaltung: Du wählst den Gang (leicht/schwer). Das Treten ist die eigentliche Leistung (Parameterlernen); der Gang ist die Voreinstellung (Hyperparameter), die das Treten effizient macht.
• Radio‑Tuner: Du drehst am Sendersuch‑Knopf und an der Lautstärke. Beides sind Einstellungen, die bestimmen, wie gut das Signal ankommt.
Professionelle Definition
Hyperparameter sind Steuergrößen des Lernprozesses, die du vor oder rund um das Training festlegst. Sie bestimmen z. B. wie schnell gelernt wird (Lernrate), wie stark vereinfacht wird (Regularisierung), wie groß das Modell ist (Architektur) oder wie Daten vorbereitet werden (Augmentation, Tokenizer‑Vokabular). Das Modell lernt anschließend seine Gewichte unter diesen Vorgaben.
Hyperparameter‑Optimierung bedeutet: Du definierst plausible Wertebereiche, trainierst mit mehreren Konfigurationen, misst die Leistung auf Validierungsdaten und übernimmst die beste. Damit steuerst du Generalisierung und Trainingseffizienz. Suchräume können kontinuierlich, diskret oder kategorial sein; oft nutzt man logarithmische Skalen für Größen wie Lernrate oder Weight Decay.
Gängige Suchverfahren:
- Random Search und Grid Search als einfache Baselines.
- Bayesian Optimization (z. B. Gaussian‑Process‑ oder TPE‑Ansätze) zur gezielten Auswahl vielversprechender Konfigurationen.
- Multi‑Fidelity‑Methoden wie Successive Halving/Hyperband/ASHA: erst mit kleinem Budget testen, dann gute Kandidaten hochskalieren.
- Kombinierte Ansätze wie BOHB oder Population Based Training für dynamisches Nachjustieren.
Qualität & Risiken:
- Saubere Daten‑Splits ohne Leaks; bei wenig Daten verschachtelte Cross‑Validation in Betracht ziehen.
- Reproduzierbarkeit sichern (Seeds, feste Versionsstände) und Ergebnisse systematisch loggen.
- Interaktionen beachten: Architektur‑ und Optimizer‑Einstellungen wirken gemeinsam; zu viele Freiheitsgrade erhöhen das Risiko für Overfitting auf die Validation.
Typische Kategorien von Hyperparametern:
- Optimizer & Lernen: Lernrate, Momentum/Betas, Scheduler, Warmup, Batch‑Größe, Epochen.
- Regularisierung: Weight Decay, Dropout, Label Smoothing, Datenaugmentation.
- Architektur: Zahl der Schichten/Kanäle/Neuronen, Embedding‑Größe, Kernelgrößen, Residual‑/Norm‑Varianten.
- Daten & Vorverarbeitung: Tokenizer‑Vokabular, Max‑Sequenzlänge, Normalisierung, Sampling‑Strategien.
Praxis‑Tipps
- Random Search als starker Startpunkt; deckt hohe Dimensionen besser ab als Grid.
- Log‑Skalen für Größen wie Lernrate, Weight Decay, C, (\lambda); breite, plausible Bereiche nutzen.
- Multi‑Fidelity arbeiten: erst kleine Budgets (wenige Epochen, Teilmenge Daten), dann promising Konfigurationen hochskalieren (Hyperband/ASHA).
- Early Stopping aktivieren und bestes Checkpoint sichern; Scheduler wie Reduce‑on‑Plateau helfen.
- Robuste Validierung: Stratifizierte Splits, keine Leaks, bei kleinen Daten K‑Fold oder nested CV.
- Reproduzierbarkeit: Seeds setzen, Konfigurationen & Ergebnisse loggen (z. B. mit Optuna/Weights & Biases).
- Interaktionen beachten: Architektur und Optimizer‑Hyperparameter gemeinsam betrachten; zu viele Freiheitsgrade vermeiden.
Quellen
- Bergstra, J. & Bengio, Y. (2012) – Random Search for Hyper‑Parameter Optimization
https://jmlr.org/papers/volume13/bergstra12a/bergstra12a.pdf - Snoek, J., Larochelle, H., Adams, R. (2012) – Practical Bayesian Optimization of Machine Learning Algorithms
https://arxiv.org/abs/1206.2944 - Li, L. et al. (2017) – Hyperband: A Novel Bandit‑Based Approach to Hyperparameter Optimization
https://arxiv.org/abs/1603.06560 - Hutter, F., Kotthoff, L., Vanschoren, J. (2019) – Automated Machine Learning: Methods, Systems, Challenges
https://automl.org/book/ - scikit‑learn – Tuning the hyper‑parameters of an estimator
https://scikit-learn.org/stable/modules/grid_search.html - Optuna – Framework for hyperparameter optimization
https://optuna.org/
Weiterführende Informationen KI Grundlagen