Einfach erklärt
Überanpassung bedeutet: Ein Lernmodell merkt sich die Trainingsdaten zu genau. Es lernt auch Zufall und Fehler im Datensatz. Dadurch klappt es im Training sehr gut, macht aber bei neuen, unbekannten Daten mehr Fehler.
Warum passiert das? Häufig ist das Modell zu groß oder zu flexibel, es gibt zu wenig oder ungeeignete Daten, oder die Auswertung ist falsch aufgebaut (z. B. wurden Testdaten versehentlich fürs Training benutzt).
Beispiele:
- Zu viele Kurvenwindungen: Eine sehr komplizierte Kurve trifft alle Trainingspunkte, verfehlt aber neue Punkte.
- Sehr tiefer Entscheidungsbaum: Merkt sich Spezialfälle der Trainingsdaten und verallgemeinert schlecht.
- Datenleckage: Informationen, die später nicht verfügbar sind (z. B. aus der Zukunft oder aus dem Testsatz), landen im Training – das Ergebnis wirkt „zu gut“ und bricht im Einsatz ein.
Professionelle Definition
Überanpassung beschreibt in Statistik und maschinellem Lernen die Situation, dass ein Verfahren neben der eigentlichen Struktur auch das Rauschen der Trainingsstichprobe modelliert. Typisch ist ein sehr kleiner Trainingsfehler bei zugleich erhöhtem Generalisierungsfehler auf unabhängigen Daten. Sichtbar wird dies in Lernkurven (fallender Trainingsfehler, steigender Validierungsfehler). Überanpassung steht im Zusammenhang mit hoher Modellkapazität bzw. -varianz.
Diagnostik und Gegenmaßnahmen:
- Strikte Datenaufteilung und Kreuzvalidierung zur verlässlichen Schätzung der Leistung und fürs Hyperparameter‑Tuning.
- Regularisierung (z. B. L1/L2‑Gewichtsnormen, frühzeitiges Stoppen, Dropout‑Verfahren) zur Begrenzung der effektiven Modellkomplexität.
- Modellvereinfachung (z. B. Baumschnitt), Modellverbünde (Bagging/Boosting) und Datenvermehrung (Augmentation) je nach Aufgabe.
- Schutz vor Datenleckage durch korrekte Pipelines (Vorverarbeitung nur auf Trainingsdaten, zeitgerechte Splits bei Zeitreihen).
Quellen
- Wikipedia – Überanpassung/Overfitting (Begriff, Lernkurven, Hintergründe)
https://en.wikipedia.org/wiki/Overfitting - scikit‑learn – Underfitting vs. Overfitting (Demonstration mit Polynom‑Merkmalen)
https://scikit-learn.org/stable/auto_examples/model_selection/plot_underfitting_overfitting.html - Goodfellow/Bengio/Courville – Deep Learning (Kapitel Regularisierung/Generalisierung)
https://egrcc.github.io/docs/dl/deeplearningbook-regularization.pdf - IBM – Was ist Datenleckage im maschinellen Lernen? (Definition und Risiken)
https://www.ibm.com/think/topics/data-leakage-machine-learning - AWS Prescriptive Guidance – Splits und Datenleckage (Bewährte Verfahren)
https://docs.aws.amazon.com/prescriptive-guidance/latest/ml-operations-planning/splits-leakage.html