1) Einfach erklärt
Überwachtes Lernen bedeutet: Eine KI lernt aus Beispielen mit „richtiger Antwort“. Zu jedem Eingabedatum (z. B. Bild, Text, Messwert) gibt es ein Label (z. B. „Katze“, „Spam“, Preis). Die KI passt sich so an, dass ihre Vorhersagen möglichst oft mit den Labels übereinstimmen.
Beispiele:
- Bildklassifikation: Fotos werden als „Katze“ oder „Hund“ beschriftet → Das Modell lernt, neue Fotos richtig einzuordnen (Klassifikation).
- Spam‑Filter: E‑Mails sind als „Spam“/„Nicht‑Spam“ markiert → Der Filter lernt, neue Mails abzufangen (binäre Klassifikation).
- Hauspreise schätzen: Für Häuser sind Merkmale (Lage, Größe) und Preis bekannt → Das Modell schätzt den Preis eines neuen Hauses (Regression).
Ablauf (vereinfacht): Daten mit Labels → Trainieren → Prüfen auf neuen Daten → Einsetzen. Wichtig sind genug gute Daten, keine Verzerrungen und realistische Tests.
2) Professionelle Definition
Beim Supervised Learning hat man Trainingspaare (xi,yi)i=1n(x_i, y_i)_{i=1}^n(xi,yi)i=1n aus Eingaben xxx und Zielgrößen yyy. Man wählt ein Modell fθf_\thetafθ und minimiert den empirischen Risikofunktional (Empirical Risk Minimization): minθ 1n∑i=1nℓ(fθ(xi), yi)\min_{\theta} \; \frac{1}{n} \sum_{i=1}^n \ell\big(f_\theta(x_i),\, y_i\big)minθn1∑i=1nℓ(fθ(xi),yi) mit einer Verlustfunktion ℓ\ellℓ (z. B. Kreuzentropie für Klassifikation, MSE für Regression). Ziel ist gute Generalisation auf unbekannten Daten.
Typen:
- Klassifikation (diskrete Labels; binär oder multi‑klassig),
- Regression (stetige Zielgrößen),
- Sequenz‑/Strukturvorhersagen (z. B. Tagging, Parsing).
Praxisbausteine:
- Datenaufteilung (Train/Valid/Test), Kreuzvalidierung,
- Regularisierung (Gewichtszerfall, Dropout, Frühstopp), Hyperparameter‑Suche,
- Klassengewicht/Resampling bei Unausgewogenheit,
- Kennzahlen: Accuracy, Precision/Recall/F1, ROC‑AUC (Klassifikation); MAE/RMSE/R² (Regression).
Grenzen & Hinweise: Label‑Qualität/‑Bias beeinflussen das Ergebnis; Overfitting bei zu komplexen Modellen; Daten‑/Domänen‑Shift erfordert Monitoring und ggf. Nachtraining.
Abgrenzung:
- Unsupervised Learning: ohne Labels (z. B. Clustering).
- Reinforcement Learning: Belohnungen statt fester Labels, Handeln über Zeit.
Quellen
- Stanford CS229 – Supervised Learning (Lecture Notes/Übersicht)
https://cs229.stanford.edu/ - The Elements of Statistical Learning (Hastie/Tibshirani/Friedman) – Online‑Buch
https://hastie.su.domains/ElemStatLearn/ - scikit‑learn – Supervised learning (User Guide/Modelle & Metriken)
https://scikit-learn.org/stable/supervised_learning.html