Einfach erklärt
Gradientenabstieg ist ein Verfahren, mit dem ein Modell seine Fehler Schritt für Schritt verringert. Nach jeder Vorhersage wird der Fehler mit einer Verlustfunktion gemessen. Dann werden die Modellwerte ein kleines Stück in die Richtung verändert, in der der Fehler am stärksten abnimmt. Das macht man viele Male, bis sich der Fehler kaum noch verbessert.
Wichtige Punkte:
- Schrittweite (Lernrate): Ist sie zu groß, „überspringt“ man das Ziel; ist sie zu klein, dauert das Lernen sehr lange.
- Stochastische Variante (mit Datenportionen): Statt alle Daten auf einmal zu nutzen, lernt man in kleinen Päckchen. Das ist oft schneller und genügt für gute Ergebnisse.
- Verbesserungen: Verfahren wie Momentum, RMSProp oder Adam passen die Schritte automatisch an und beschleunigen das Lernen.
Professionelle Definition
Für eine differenzierbare Ziel‑/Verlustfunktion (L(\theta)) mit Parametern (\theta) erzeugt der Gradientenabstieg eine Folge ({\theta_t}) durch
[\theta_{t+1}=\theta_t-\eta_t,\nabla L(\theta_t),]
wobei (\eta_t>0) die (möglicherweise zeitabhängige) Lernrate ist. In der stochastischen Variante wird (\nabla L(\theta_t)) durch den Gradienten auf einem einzelnen Beispiel oder Mini‑Batch ersetzt. Varianten wie Momentum/Heavy‑Ball, RMSProp (skalierte Schrittweiten je Parameter) und Adam (bias‑korrigierte erste/zweite Momente) verbessern Konvergenz und Robustheit.
Quellen
- Wikipedia – Gradient descent (Definition, Update‑Regel, Einsatz)
https://en.wikipedia.org/wiki/Gradient_descent - Wikipedia – Stochastic gradient descent (Variante mit Einzelbeispielen/Mini‑Batches)
https://en.wikipedia.org/wiki/Stochastic_gradient_descent - Kingma & Ba (2014) – Adam: A Method for Stochastic Optimization (Originalarbeit)
https://arxiv.org/abs/1412.6980 - Kingma & Ba (2015) – Adam (PDF, ICLR‑Version)
https://arxiv.org/pdf/1412.6980 - Hinton (2012) – Vorlesungsfolien: RMSProp (Idee und Begründung)
https://www.cs.toronto.edu/~tijmen/csc321/slides/lecture_slides_lec6.pdf