6 A B C D E F G H I K L M N O P Q R S T U V W Z

Batch Normalization

Einfach erklärt

Stell dir vor, ein Netz lernt aus kleinen Daten‑Päckchen (Minibatches). In jedem Päckchen können die Werte mal sehr groß, mal sehr klein sein. Das verwirrt das Lernen.

Batch‑Normalisierung ordnet diese Werte zuerst:

  • Sie rückt die Werte so, dass der Durchschnitt ungefähr 0 ist.
  • Sie streckt/quetscht die Werte so, dass die Streuung ungefähr 1 ist.
  • Danach dürfen zwei Regler (Skalieren und Verschieben) die Werte wieder passend einstellen – das lernt das Netz selbst.

So kann das Netz ruhiger, schneller und zuverlässiger lernen.

Einfache Beispiele/Analogien:

  • Lautstärke angleichen: Erst alle Musikstücke auf ähnliche Lautstärke bringen, dann fein nachregeln – so hört man Details besser.
  • Fotos vereinheitlichen: Ein Stapel Bilder wird erst auf ähnliche Helligkeit gebracht; danach kann die Bildverarbeitung feine Unterschiede besser erkennen.
  • Backen mit Messbecher: Erst gleiche Grundmenge abmessen, dann «nach Geschmack» würzen – das entspricht den zwei Reglern.

Professionelle Definition

Gegeben Aktivierungen (x) über ein Minibatch werden pro Kanal Batch‑Statistiken (\mu_B,,\sigma_B^2) berechnet und
[\hat x = \frac{x-\mu_B}{\sqrt{\sigma_B^2+\varepsilon}}]
gebildet. Mit lernbaren Parametern (\gamma) (Skalierung) und (\beta) (Verschiebung) ergibt sich die Ausgabe (y=\gamma,\hat x+\beta). Während der Inferenz nutzt man gleitende Schätzer (Laufmittel) für Mittelwert und Varianz. Batch‑Normalisierung wirkt als Regularisierung und verändert die effektive Optimierungslandschaft, was empirisch die Konvergenz verbessert.

Finden Sie mehr dazu in Grundlagen der Künstlichen Intelligenz

Quellen