6 A B C D E F G H I K L M N O P Q R S T U V W Z
Va Ve Vi

Einfach erklärt

Eine Wertfunktion sagt, wie gut es ist, sich jetzt in einem bestimmten Zustand zu befinden (oder dort eine Aktion zu wählen) – gemessen an der erwarteten zukünftigen Belohnung. Sie ist damit ein zentraler Baustein im Reinforcement Learning: Mit ihr kann ein Agent abschätzen, welche Situationen langfristig lohnen und welche nicht.

Ganz einfache Beispiele:

• Labyrinth: Ein Feld nahe am Ziel hat einen hohen Wert (kurz vor viel Belohnung), ein Feld nahe einer Falle hat niedrigen Wert.
• Energie sparen: Ein Zustand „Akku fast leer, Steckdose in der Nähe“ hat hohen Wert, „Akku fast leer, weit weg von Steckdosen“ niedrigen Wert.
• Kundendienst‑Dialog: Ein Gesprächszustand, der wahrscheinlich zu hoher Zufriedenheit führt, hat höheren Wert als ein Zustand, der oft in Abbruch endet.

Professionelle Definition

In einem MDP ((\mathcal S,\mathcal A,P,R,\gamma)) und für eine gegebene Policy (\pi) ist die Zustands‑Wertfunktion
[V^{\pi}(s)=\mathbb E_{\pi}\Big[\sum_{t=0}^{\infty}\gamma^t r_t,\Big|,s_0=s\Big]]
die erwartete abgezinste Summe künftiger Belohnungen ab Zustand (s). Die Aktions‑Wertfunktion (Q‑Funktion)
[Q^{\pi}(s,a)=\mathbb E_{\pi}\Big[\sum_{t=0}^{\infty}\gamma^t r_t,\Big|,s_0=s,\ a_0=a\Big]]
misst den Wert, wenn zuerst Aktion (a) ausgeführt wird. Beide erfüllen die Bellman‑Gleichungen:
[V^{\pi}(s)=\sum_{a}\pi(a\mid s)\Big(R(s,a)+\gamma\sum_{s‘}P(s’\mid s,a)V^{\pi}(s‘)\Big),]
[Q^{\pi}(s,a)=R(s,a)+\gamma\sum_{s‘}P(s’\mid s,a)\sum_{a‘}\pi(a’\mid s‘)Q^{\pi}(s‘,a‘).]
Die optimalen Wertfunktionen (V^{},Q^{}) genügen den optimalen Bellman‑Gleichungen (mit (\max) statt (\pi)).

Bezug zu Lernverfahren:
• Dynamische Programmierung: Wertiteration/Politik‑Iteration lösen die Bellman‑Gleichungen, wenn (P,R) bekannt sind.
• Temporal‑Difference (TD): Schätzt Werte aus Erfahrungen (z. B. TD(0), SARSA, Q‑Learning).
• Actor‑Critic: Der Critic lernt eine Wertfunktion, der Actor verbessert die Policy mithilfe dieser Werte.

Quellen

• Sutton & Barto – Reinforcement Learning: An Introduction (Wertfunktionen, Bellman‑Gleichungen, TD‑Lernen)
http://incompleteideas.net/book/the-book.html

• Wikipedia – Value function (reinforcement learning) (Zustands‑/Aktions‑Werte, Bellman‑Beziehungen)
https://en.wikipedia.org/wiki/Value_function_(reinforcement_learning)

• Wikipedia – Bellman equation (Hintergrund/Herleitung, optimale Gleichungen)
https://en.wikipedia.org/wiki/Bellman_equation

• Puterman (2014) – Markov Decision Processes: Discrete Stochastic Dynamic Programming (Wertfunktionen, DP)
https://onlinelibrary.wiley.com/doi/book/10.1002/9781118625591

• Watkins & Dayan (1992) – Q‑learning (Lernen der optimalen Q‑Funktion aus Erfahrung)
https://link.springer.com/article/10.1007/BF00992698