Einfach erklärt
Backpropagation – Standardverfahren zur Gradientenberechnung –Backpropagation ist die Rückwärts‑Rechnung in neuronalen Netzen: Wir schauen, wie sehr jeder Gewichts‑Knopf am Fehler beteiligt war. Diese „Schuld“ (Gradient) schicken wir von hinten nach vorne durch das Netz. So wissen wir, welche Knöpfe wir wie drehen müssen, damit der Fehler beim nächsten Mal kleiner wird.
Kurz: Vorwärts rechnen → Fehler messen → rückwärts sagen, welcher Teil wie stark schuld war → Knöpfe anpassen.
Ganz einfache Beispiele (mit Alltagsbildern)
• Fließband mit Qualitätscheck: Am Ende (Ausgang) merkst du: Der Keks ist zu salzig. Du gehst das Band rückwärts ab und schaust an jeder Station (Schritt/Schicht), wie stark sie zur Übersalzung beigetragen hat. Dann drehst du diese Stellschrauben ein wenig zurück.
• Kettenreaktion aus Zahnrädern: Viele Räder greifen ineinander. Am Ende dreht sich das letzte zu schnell. Du drehst den Effekt rückwärts durch die Kette: Jedes Zahnrad bekommt gesagt, wie viel es zum Tempo beigetragen hat. Danach justierst du jedes ein kleines Stück.
• Klassenprojekt‑Feedback: Die Note ist schlecht. Statt nur den Präsentator zu tadeln, gehst du zurück: Recherche, Folien, Proben… Jede Gruppe bekommt genaues Feedback, wie stark ihr Anteil die Note gedrückt hat – und verbessert gezielt.
Professionelle Definition (verständlich)
Backpropagation berechnet Gradienten der Verlustfunktion effizient mit der Kettenregel, und zwar in umgekehrter Reihenfolge der Vorwärtsrechnung (Reverse‑Mode Autodiff):
- Vorwärts‑Pass: Eingabe → Schichten → Ausgabe; dann Loss berechnen.
- Rückwärts‑Pass: Starte am Loss und propagierte Fehler‑Signale („Ableitungen“) Schicht für Schicht zurück. Jede Schicht nutzt nur ihre lokalen Ableitungen (z. B. der Aktivierungsfunktion) und das Fehlersignal der nächsten Schicht.
- Update: Mit einem Optimierer (z. B. Gradient Descent/Adam) werden Gewichte entlang des negativen Gradienten leicht verschoben (z. B.
w := w − η · grad).
Wichtig: Backprop hat ähnliche Rechenkosten wie ein Vorwärts‑Pass, skaliert gut auf große Netze und funktioniert mit beliebigen Architekturen (CNNs, RNNs, Transformern), solange die Operationen differenzierbar sind.
Praxis‑Tipps (einfach)
- Aktivierungen & Normalisierung: ReLU/GELU + Batch/Layer Norm helfen gegen verschwindende/eksplodierende Gradienten.
- Initialisierung: He/Kaiming (ReLU‑artig) oder Xavier (tanh/sigmoid) sorgen für gesunden Gradientenfluss.
- Lernrate: Zu groß → Divergenz, zu klein → langsames Lernen. Scheduler nutzen.
- Gradient Clipping: Begrenzt zu große Schritte (besonders bei RNNs).
- Autodiff‑Frameworks: PyTorch/JAX/TensorFlow erledigen Backprop automatisch – wichtig ist korrekte Modellierung und Loss.
Quellen
- Rumelhart, Hinton, Williams (1986) – Learning representations by back‑propagating errors
https://www.nature.com/articles/323533a0 - Werbos (1974/1982) – Beyond Regression: New Tools for Prediction and Analysis in the Behavioral Sciences / Applications of advances in nonlinear sensitivity analysis
http://werbos.com/
https://ieeexplore.ieee.org/document/6313077 - LeCun et al. (1998) – Efficient BackProp
http://yann.lecun.com/exdb/publis/pdf/lecun-98b.pdf - Baydin et al. (2018) – Automatic differentiation in machine learning: a survey
https://arxiv.org/abs/1502.05767 - Goodfellow, Bengio, Courville (2016) – Deep Learning (Ch. 6–8: Backprop/Optimization)
https://www.deeplearningbook.org/ - Bishop (2006) – Pattern Recognition and Machine Learning (Kap. 5: Neural Networks)
https://www.microsoft.com/en-us/research/people/cmbishop/#!/prml