Einfach erklärt
Q‑Learning ist ein Lernverfahren, das ohne Modell der Umwelt herausfindet, welche Aktion in welchem Zustand langfristig gut ist. Es lernt dafür eine Tabelle/Funktion Q(s, a): „Wie lohnend ist Aktion a im Zustand s?“
So funktioniert es in kurz:
• Erkunden & Belohnen: Der Agent probiert Aktionen aus, erhält Belohnungen und sieht den nächsten Zustand.
• Schätzen & Verbessern: Nach jedem Schritt wird der Q‑Wert ein Stück in Richtung „besserer Schätzwert“ bewegt.
• Ziel: Eine Regel (Policy) ableiten, die in jedem Zustand die beste Aktion wählt.
• Keine Modell‑Kenntnis nötig: Übergangswahrscheinlichkeiten müssen nicht bekannt sein.
Professionelle Definition
Für ein MDP ((\mathcal S,\mathcal A,P,R,\gamma)) aktualisiert Q‑Learning nach einem Übergang ((s_t,a_t,r_t,s_{t+1})) die Aktions‑Werte über
[Q_{t+1}(s_t,a_t);=;(1-\alpha),Q_t(s_t,a_t);+;\alpha,\Big[r_t;+;\gamma,\max_{a‘} Q_t(s_{t+1},a‘)\Big],]
wobei (\alpha\in(0,1]) die Lernrate und (\gamma\in[0,1)) der Abzinsfaktor ist. Q‑Learning ist off‑policy (nutzt die Greedy‑Zielpolitik mit (\max), auch wenn die Verhaltenspolitik exploriert, z. B. (\varepsilon)‑gierig). Unter Standardbedingungen (endliches MDP, hinreichende Exploration, abnehmende Lernrate) konvergiert (Q_t) mit Wahrscheinlichkeit 1 zu (Q^{*}). Die daraus abgeleitete Greedy‑Policy ist optimal.
Verwandte/erweiterte Verfahren:
• SARSA: On‑policy‑Update mit (Q(s_{t+1},a_{t+1})) statt (\max_{a‘}).
• Double Q‑Learning: Trennt Schätzung und Auswahl, um Überschätzung durch das (\max) zu reduzieren.
• Funktionale Approximation/DQN: Neuronale Netze approximieren (Q_\theta(s,a)); Stabilisierung via Experience Replay und Zielnetz.
Quellen
- Wikipedia – Q‑learning (Überblick, Update‑Gleichung, Konvergenz‑Hinweise)
https://en.wikipedia.org/wiki/Q-learning - Watkins & Dayan (1992) – Q‑learning (Originalarbeit, Konvergenz im endlichen MDP)
https://link.springer.com/article/10.1007/BF00992698 - Sutton & Barto – Reinforcement Learning: An Introduction (Kapitel zu Q‑Learning/SARSA)
http://incompleteideas.net/book/the-book.html - van Hasselt (2010) – Double Q‑learning (Reduktion der Überschätzung)
https://papers.mlr.press/v9/hasselt10a.html - Mnih et al. (2015) – Human‑level control through deep reinforcement learning (DQN)
https://www.nature.com/articles/nature14236