6 A B C D E F G H I K L M N O P Q R S T U V W Z
Pa Po Pr

Policy (Strategie im Reinforcement Learning)

Einfach erklärt

Eine Policy ist die Regel, nach der ein Agent in jedem Zustand eine Aktion wählt. Sie sagt also: „Wenn ich so eine Situation sehe, tue ich das.“ Damit ist die Policy der zentrale Baustein im Reinforcement Learning – ohne Policy gibt es keine Entscheidung.

Ganz einfache Beispiele:

• Labyrinth‑Roboter: „Bei Wand links → nach rechts drehen; bei Kreuzung → geradeaus, wenn frei“ – das ist eine Policy.
• Empfehlungen: „Wenn Nutzer A oft Kategorie X schaut → zuerst X vorschlagen“ – eine (vereinfachte) Policy.
• Ampelsteuerung: „Wenn Stau auf Nord‑Süd und Ost‑West frei → länger Grün für Nord‑Süd“ – ebenfalls eine Policy.

Professionelle Definition

In einem MDP ((\mathcal S,\mathcal A,P,R,\gamma)) ist eine Policy eine Abbildung (\pi(a\mid s)), die für jeden Zustand (s) eine Verteilung über Aktionen (a) vorgibt (stochastische Policy). Eine deterministische Policy ist (\mu: \mathcal S\to\mathcal A). Eine Policy induziert den Wert
[V^{\pi}(s)=\mathbb E_{\pi}\Big[\sum_{t=0}^{\infty}\gamma^t r_t,\Big|,s_0=s\Big],\quad Q^{\pi}(s,a)=\mathbb E_{\pi}\Big[\sum_{t=0}^{\infty}\gamma^t r_t,\Big|,s_0=s,a_0=a\Big].]
Ziele des RL sind Policy‑Evaluation (Werte unter (\pi) bestimmen) und Policy‑Improvement/Kontrolle (bessere Policy finden), klassisch per Politik‑Iteration oder Wertiteration sowie modellfrei (z. B. Q‑Learning, SARSA, Actor‑Critic).

Bei Policy‑Gradient‑Verfahren wird eine differenzierbare stochastische Policy (\pi_\theta(a\mid s)) direkt über den Erwartungs‑Rücklauf optimiert (z. B. REINFORCE), mit Gradientenformeln wie dem Policy‑Gradient‑Theorem. Exploration wird durch stochastische Policies oder Explorationsrauschen erreicht; unter üblichen Bedingungen existiert eine optimale stationäre Policy.

Quellen

• Sutton & Barto – Reinforcement Learning: An Introduction (Kapitel zu Policies, Wertfunktionen, Policy Gradient)
http://incompleteideas.net/book/the-book.html

• Wikipedia – Policy gradient (Grundidee, Formeln, REINFORCE, Actor‑Critic)
https://en.wikipedia.org/wiki/Policy_gradient

• Wikipedia – Markov decision process (Definition von MDPs, optimale Policy, Bellman‑Gleichungen)
https://en.wikipedia.org/wiki/Markov_decision_process

• Puterman (2014) – Markov Decision Processes: Discrete Stochastic Dynamic Programming (optimale stationäre Policies, DP)
https://onlinelibrary.wiley.com/doi/book/10.1002/9781118625591

• Williams (1992) – Simple Statistical Gradient‑Following Algorithms for Connectionist Reinforcement Learning (REINFORCE)
https://link.springer.com/article/10.1007/BF00992696