6 A B C D E F G H I K L M N O P Q R S T U V W Z

Reinforcement Learning


1) Einfach erklärt

Reinforcement Learning (RL, deutsch bestärkendes Lernen) heißt: Eine KI probiert Handlungen aus und bekommt dafür Rückmeldung (z. B. Belohnung oder Strafe). Mit der Zeit lernt sie, so zu handeln, dass insgesamt möglichst viel Belohnung zusammenkommt.

Wie funktioniert das?

  • Eine Figur (Agent) handelt in einer Umgebung (Spiel, Roboter, Anlage).
  • Nach jeder Handlung gibt es Feedback (Belohnung).
  • Die KI passt ihre Strategie an: Was viel Belohnung bringt, wird häufiger gemacht.

Alltags‑Beispiele:

  • Spiele: Eine KI lernt Atari‑Spiele oder Go nur durch Punkte/Sieg.
  • Roboter‑Arm: Probiert Greifen aus; erfolgreiche Griffe werden belohnt → der Arm wird treffsicherer.
  • Energie‑Steuerung: Heizung regelt so, dass es komfortabel und sparsam bleibt.

Wichtige Idee: Ausprobieren vs. Ausnutzen. Die KI muss Neues testen (vielleicht gibt es noch bessere Handlungen), darf aber Gelerntes nutzen, um Belohnung zu sammeln.

Achtung: Die Belohnung muss klug definiert sein – sonst optimiert die KI am Ziel vorbei („Belohnungs‑Hacking“).


2) Professionelle Definition

Reinforcement Learning formalisiert Lernen in Markov‑Entscheidungsprozessen (MDP) (S,A,P,R,γ)(\mathcal{S},\mathcal{A},P,R,\gamma)(S,A,P,R,γ). Ein Agent wählt gemäß Politik π(a∣s)\pi(a\mid s)π(a∣s) Aktionen in Zuständen s∈Ss\in\mathcal{S}s∈S. Ziel ist die Maximierung des erwarteten diskontierten Returns J(π)=E[∑k=0∞γkrt+1+k]J(\pi)=\mathbb{E}[\sum_{k=0}^{\infty} \gamma^{k} r_{t+1+k}]J(π)=E[∑k=0∞​γkrt+1+k​]. Wertfunktionen Vπ(s),  Qπ(s,a)V^{\pi}(s),\; Q^{\pi}(s,a)Vπ(s),Qπ(s,a) erfüllen Bellman‑Gleichungen; Optimierung erfolgt wertbasiert (Q‑Learning, SARSA, DQN), politikbasiert (Policy Gradient/REINFORCE) oder Aktor‑Kritiker (A2C/A3C, PPO). Exploration (z. B. ε‑greedy, Entropie‑Regulierung) und Funktionapproximation (tiefe Netze) sind zentral. Varianten/Erweiterungen: Modell‑frei vs. Modell‑basiert, On‑/Off‑Policy, Offline RL, Mehrziel‑RL, Hierarchisches RL, Sicheres RL. Herausforderungen: Stabilität, Sample‑Effizienz, Belohnungsdesign, Verallgemeinerung und Sicherheit im Echtbetrieb.


Quellen