Einfach erklärt

Metriken zur Bewertung von Modellen – BLEU sagt, wie ähnlich ein übersetzter oder generierter Text zu guten Referenztexten ist. Es vergleicht Wort‑Päckchen (2er, 3er, 4er‑Wortfolgen) zwischen Vorhersage und Referenz.
Je mehr passende Wort‑Päckchen gefunden werden – und je nicht zu kurz der Text ist – desto höher der BLEU‑Wert (0 bis 100, oft 0–1 dargestellt).

Kurz: Viele passende Wortfolgen + keine künstliche Kürze → hoher BLEU.

Ganz einfache Beispiele (mit Alltagsbildern)

• Puzzle‑Vergleich: Du baust ein Puzzle nach Vorlage. Je mehr richtige Teilstücke an richtigen Stellen sitzen, desto besser. Einzelne passende Farben reichen nicht – die Nachbarschaft (2er/3er/4er‑Stücke) muss stimmen.
• Kochrezept‑Check: In deinem Rezept tauchen genau die gleichen Schritt‑Folgen wie in Omas Rezept auf („Zwiebel anbraten“, „mit Salz würzen“) → guter BLEU. Fehlt viel oder sind die Schritte vertauscht, sinkt der BLEU.
• Nicht schummeln durch Kürzen: Ein sehr kurzer Text macht kaum Fehler, aber sagt nichts – BLEU hat eine Längen‑Strafe, damit Abkürzen nicht belohnt wird.

Professionelle Definition (verständlich)

BLEU ist eine korpus‑basierte Metrik. Sie nutzt modifizierte n‑Gram‑Präzision (mit Clipping, damit Wiederholungen nicht künstlich Punkte bringen) für n = 1…4 und bildet die geometrische Mitte (log‑Mittel) dieser Präzisionen. Dazu kommt eine Brevity Penalty (BP), die < 1 ist, wenn die Hypothesen kürzer als die Referenzen sind.

Formel (in Worten):

  • Zähle für jedes n (1–4), wie viele n‑Gramme der Hypothese auch in den Referenzen vorkommen (gedeckelt durch die Häufigkeit in den Referenzen).
  • Teile durch die Anzahl aller n‑Gramme der Hypothese → modifizierte Präzision.
  • Bilde das log‑Mittel über n = 1…4 (Gewichte meist 1/4).
  • Multipliziere mit der Brevity Penalty (straft zu kurze Hypothesen).

Wichtig in der Praxis:

  • Corpus‑BLEU ist stabiler als Satz‑BLEU (das ist sehr schwankend; man nutzt dann Smoothing).
  • Tokenisierung/Normalisierung beeinflussen BLEU stark → nutze sacreBLEU, um vergleichbare Scores zu bekommen.
  • Grenzen: BLEU prüft Oberflächen‑Übereinstimmung – Bedeutung, Synonyme, Wortstellung jenseits der n‑Gramme sieht BLEU nur indirekt. Kombiniere mit menschlicher Bewertung oder semantischen Metriken (z. B. COMET, BERTScore).

Quellen

  1. Papineni, Roukos, Ward, Zhu (2002) – BLEU: a Method for Automatic Evaluation of Machine Translation
    https://aclanthology.org/P02-1040/
  2. Chen & Cherry (2014) – A Systematic Comparison of Smoothing Techniques for Sentence-Level BLEU
    https://aclanthology.org/W14-3346/
  3. Post (2018) – A Call for Clarity in Reporting BLEU Scores (sacreBLEU)
    https://aclanthology.org/W18-6319/
  4. Koehn (2010/2020) – Statistical/Neural Machine Translation (Lehrbuch, Evaluationskapitel)
    https://aclanthology.org/W18-6319/ (Hinweis: siehe Buch/Slides)
  5. Zhang* et al. (2019) – BERTScore: Evaluating Text Generation with BERT
    https://arxiv.org/abs/1904.09675
  6. Rei* et al. (2020) – COMET: A Neural Framework for MT Evaluation
    https://aclanthology.org/2020.emnlp-main.213/