Einfach erklärt

Beam Search lässt das Sprachmodell mehrere gute Satzanfänge gleichzeitig weiterdenken. Es merkt sich immer die K besten Kandidaten (K = Beam‑Breite). Bei jedem neuen Wort werden alle Kandidaten ein Stück verlängert und dann wieder die K besten behalten. So kommt das Modell häufiger zu runden, sinnvollen Sätzen als wenn es nur immer die eine gerade beste Option nimmt.

Kurz: Greedy = nur eine Spur.
Beam Search = mehrere Spuren offen halten und am Ende die beste wählen.

Ganz einfache Beispiele (mit Alltagsbildern)

• Labyrinth mit Merkliste: Du suchst den Ausgang. Statt nur einem Weg zu folgen, merkst du dir die K vielversprechendsten Wege. Du gehst jeden ein kleines Stück, prüfst, wie gut er aussieht, und behältst wieder die K besten. Am Ende nimmst du den, der wirklich zum Ziel führt.

• Satz vervollständigen im Kopf: „Ich trinke gern …“ – drei gute Ideen: Kaffee, Tee, Wasser. Du denkst alle drei Sätze 2–3 Wörter weiter („mit Milch“, „am Morgen“, …) und merkst: Die Kaffee‑Spur klingt am Ende am besten → du wählst sie.

• Urlaubsplanung: Du hältst mehrere Routen offen (Auto, Zug, Flug). Nach und nach fällt raus, was zu teuer oder zu lang ist. Übrig bleibt die beste Gesamtoption.

Professionelle Definition (verständlich)

Beim Texten entsteht eine Folge von Wörtern y₁, y₂, …. Nach jedem Schritt kennt das Modell Wahrscheinlichkeiten für das nächste Wort. Beam Search speichert die K besten Teil‑Sätze mit ihren Scores (aufsummierte Log‑Wahrscheinlichkeiten). Jeder Teil‑Satz wird mit allen möglichen nächsten Wörtern verlängert; aus allen neuen Vorschlägen werden wieder die K besten behalten. Ein Vorschlag gilt als fertig, wenn ein Ende‑Symbol erzeugt wurde – fertige Sätze konkurrieren mit unfertigen.

Wichtige Praxis‑Regler:

  • Beam‑Breite K: Größer = gründlicher, aber langsamer.
  • Längen‑Normalisierung: Lange Sätze dürfen nicht bestraft werden – man teilt den Score durch eine Längenfunktion, damit lange und kurze Sätze fair vergleichbar sind (z. B. Google‑NMT‑Formel).
  • Diversity‑Tricks: Diverse Beam Search sorgt dafür, dass die K Kandidaten unterschiedlicher sind (nicht 5× fast derselbe Satz).
  • Wann nutzen? Gut bei Übersetzung und Zusammenfassung (zielgerichtet). Für kreatives Schreiben oft Sampling (top‑p/top‑k/Temperature) besser.

Quellen

  1. Sutskever, Vinyals, Le (2014) – Sequence to Sequence Learning with Neural Networks
    https://arxiv.org/abs/1409.3215
  2. Bahdanau, Cho, Bengio (2015) – Neural Machine Translation by Jointly Learning to Align and Translate
    https://arxiv.org/abs/1409.0473
  3. Wu et al. (2016) – Google’s Neural Machine Translation System: Bridging the Gap between Human and Machine Translation (Length Normalization)
    https://arxiv.org/abs/1609.08144
  4. Vijayakumar et al. (2016) – Diverse Beam Search: Decoding Diverse Solutions from Neural Sequence Models
    https://arxiv.org/abs/1610.02424
  5. Holtzman et al. (2019) – The Curious Case of Neural Text Degeneration (Beam vs Sampling)
    https://arxiv.org/abs/1904.09751
  6. Koehn (2020) – Neural Machine Translation (Decoding‑Kapitel)
    https://arxiv.org/abs/2004.11867