6 A B C D E F G H I K L M N O P Q R S T U V W Z

Einfach erklärt

Greedy Decoding heißt: Immer die gerade beste Wahl nehmen. Bei jedem nächsten Wort nimmt das Modell das wahrscheinlichste – ohne Alternativen aufzubewahren oder zu würfeln. Es ist schnell und einfach, liefert oft solide, aber manchmal langweilige Texte.

Kurz: Greedy = „Top‑Wort jetzt sofort“.

Ganz einfache Beispiele (mit Alltagsbildern)

• Autovervollständigen auf „streng“: Deine Tastatur nimmt immer den häufigsten Vorschlag. Das wirkt meist richtig, aber überrascht nie.
• Buffet mit nur einem Teller: Am ersten Stand nimmst du das Beliebteste. Am zweiten wieder das Beliebteste, usw. Am Ende hast du nur Standards – keine spannende Mischung.
• Navigieren ohne Umwege: Du fährst bei jeder Kreuzung sofort in die offenbar schnellste Richtung, prüfst aber nicht, ob fünf Kreuzungen weiter ein Stau lauert.

Professionelle Definition (verständlich)

Beim Generieren einer Sequenz y₁, y₂, … wählt Greedy in Schritt t das Token mit der höchsten bedingten Wahrscheinlichkeit P(y_t | y_{<t}, x) (oder äquivalent: größtem Logit). Danach wird ohne Zurückblicken fortgesetzt.

Eigenschaften und Folgen:

  • Deterministisch & schnell: Ein Lauf → immer dasselbe Ergebnis.
  • Lokale statt globale Qualität: Gute kurzfristige Entscheidung, aber der Satz kann insgesamt suboptimal werden (z. B. zu kurz, wiederholend).
  • Längen‑/Wiederholungs‑Effekte: Ohne Gegenmaßnahmen tendieren Modelle zu Wiederholungen oder brechen früh ab.

Typische Gegenmittel:

  • Längen‑Kontrolle: Mindest‑/Max‑Länge setzen; Längen‑Strafe in die Punktzahl einbauen.
  • Anti‑Wiederholungs‑Heuristiken: Repetition/Presence Penalty, no‑repeat‑ngram.
  • Wenn mehr Qualität nötig ist: Beam Search (mehrere Kandidaten) oder Sampling (top‑p/top‑k mit Temperature) nutzen.

Wann gut, wann nicht?

  • Gut: Schnelle, deterministische Antworten; Fakten, Code‑Snippets, formale oder stark eingeschränkte Texte.
  • Weniger gut: Kreatives Schreiben, offene Dialoge → oft besser Sampling oder Beam.

Quellen

  1. Holtzman et al. (2019) – The Curious Case of Neural Text Degeneration (Greedy vs. Sampling, Wiederholungen)
    https://arxiv.org/abs/1904.09751
  2. Sutskever, Vinyals, Le (2014) – Sequence to Sequence Learning with Neural Networks (Decoder‑Strategien)
    https://arxiv.org/abs/1409.3215
  3. Koehn (2020) – Neural Machine Translation (Kapitel zu Decoding)
    https://arxiv.org/abs/2004.11867
  4. Hugging Face – Text Generation Strategies (Greedy, top‑k, top‑p, Penalties)
    https://huggingface.co/docs/transformers/main/en/generation_strategies
  5. OpenAI Cookbook – Text generation: sampling & decoding
    https://cookbook.openai.com/examples/text_generation_solutions