Einfach erklärt

Optimierer sind Regeln, nach denen ein Lernmodell seine Werte so ändert, dass der Fehler kleiner wird. Sie bestimmen, wie groß jeder Schritt ist und in welche Richtung er geht. Dadurch lernt das Modell schneller, stabiler und oft genauer.

Typische Optimierer:

  • SGD (stochastischer Gradientenabstieg): Lernt mit kleinen Datenpaketen. Einfach und bewährt.
  • Momentum: Nutzt einen „Schwung“, damit das Lernen nicht im Zick‑Zack verläuft und Täler schneller gefunden werden.
  • RMSProp: Passt die Schrittweite je Wert an – große Schwankungen führen zu kleineren Schritten, ruhige Bereiche zu größeren.
  • Adam: Verbindet Schwung (Momentum) mit angepassten Schrittweiten pro Wert. Funktioniert oft gut ohne viel Feintuning.

Professionelle Definition

(z. B. Adam, SGD, RMSProp) Ein Optimierer legt die Aktualisierungsregel für Parameter (\theta) fest, um eine Verlustfunktion (L(\theta)) zu minimieren. Allgemein: (\theta_{t+1}=\theta_t-\eta_t,d_t), wobei (d_t) aus Gradienten und ggf. Zusatzgrößen berechnet wird.

  • SGD/Mini‑Batch: (d_t=\nabla L_{\mathcal B_t}(\theta_t)).
  • Momentum/Heavy‑Ball: zusätzlicher Zustand (v_{t+1}=\beta v_t+\nabla L_{\mathcal B_t}(\theta_t)), Schritt mit (d_t=v_{t+1}).
  • RMSProp: skaliert den Schritt je Parameter mit einem laufenden Mittel der Gradientenquadrate: (s_{t+1}=\rho s_t+(1-\rho),g_t^2), (d_t=g_t/(\sqrt{s_{t+1}}+\varepsilon)).
  • Adam: kombiniert erste und zweite Momente mit Bias‑Korrektur: (m_{t+1}=\beta_1 m_t+(1-\beta_1)g_t), (v_{t+1}=\beta_2 v_t+(1-\beta_2)g_t^2); (\hat m_{t+1}=m_{t+1}/(1-\beta_1^{t+1})), (\hat v_{t+1}=v_{t+1}/(1-\beta_2^{t+1})); Update: (\theta_{t+1}=\theta_t-\eta,\hat m_{t+1}/(\sqrt{\hat v_{t+1}}+\varepsilon)).

Diese Verfahren beeinflussen Bias/Varianz des Schätzers, Rechenaufwand und Konvergenzverhalten – besonders in großen, nichtkonvexen Modellen.

Quellen