Einfach erklärt
Metriken zur Bewertung von Modellen – BLEU sagt, wie ähnlich ein übersetzter oder generierter Text zu guten Referenztexten ist. Es vergleicht Wort‑Päckchen (2er, 3er, 4er‑Wortfolgen) zwischen Vorhersage und Referenz.
Je mehr passende Wort‑Päckchen gefunden werden – und je nicht zu kurz der Text ist – desto höher der BLEU‑Wert (0 bis 100, oft 0–1 dargestellt).
Kurz: Viele passende Wortfolgen + keine künstliche Kürze → hoher BLEU.
Ganz einfache Beispiele (mit Alltagsbildern)
• Puzzle‑Vergleich: Du baust ein Puzzle nach Vorlage. Je mehr richtige Teilstücke an richtigen Stellen sitzen, desto besser. Einzelne passende Farben reichen nicht – die Nachbarschaft (2er/3er/4er‑Stücke) muss stimmen.
• Kochrezept‑Check: In deinem Rezept tauchen genau die gleichen Schritt‑Folgen wie in Omas Rezept auf („Zwiebel anbraten“, „mit Salz würzen“) → guter BLEU. Fehlt viel oder sind die Schritte vertauscht, sinkt der BLEU.
• Nicht schummeln durch Kürzen: Ein sehr kurzer Text macht kaum Fehler, aber sagt nichts – BLEU hat eine Längen‑Strafe, damit Abkürzen nicht belohnt wird.
Professionelle Definition (verständlich)
BLEU ist eine korpus‑basierte Metrik. Sie nutzt modifizierte n‑Gram‑Präzision (mit Clipping, damit Wiederholungen nicht künstlich Punkte bringen) für n = 1…4 und bildet die geometrische Mitte (log‑Mittel) dieser Präzisionen. Dazu kommt eine Brevity Penalty (BP), die < 1 ist, wenn die Hypothesen kürzer als die Referenzen sind.
Formel (in Worten):
- Zähle für jedes n (1–4), wie viele n‑Gramme der Hypothese auch in den Referenzen vorkommen (gedeckelt durch die Häufigkeit in den Referenzen).
- Teile durch die Anzahl aller n‑Gramme der Hypothese → modifizierte Präzision.
- Bilde das log‑Mittel über n = 1…4 (Gewichte meist 1/4).
- Multipliziere mit der Brevity Penalty (straft zu kurze Hypothesen).
Wichtig in der Praxis:
- Corpus‑BLEU ist stabiler als Satz‑BLEU (das ist sehr schwankend; man nutzt dann Smoothing).
- Tokenisierung/Normalisierung beeinflussen BLEU stark → nutze sacreBLEU, um vergleichbare Scores zu bekommen.
- Grenzen: BLEU prüft Oberflächen‑Übereinstimmung – Bedeutung, Synonyme, Wortstellung jenseits der n‑Gramme sieht BLEU nur indirekt. Kombiniere mit menschlicher Bewertung oder semantischen Metriken (z. B. COMET, BERTScore).
Quellen
- Papineni, Roukos, Ward, Zhu (2002) – BLEU: a Method for Automatic Evaluation of Machine Translation
https://aclanthology.org/P02-1040/ - Chen & Cherry (2014) – A Systematic Comparison of Smoothing Techniques for Sentence-Level BLEU
https://aclanthology.org/W14-3346/ - Post (2018) – A Call for Clarity in Reporting BLEU Scores (sacreBLEU)
https://aclanthology.org/W18-6319/ - Koehn (2010/2020) – Statistical/Neural Machine Translation (Lehrbuch, Evaluationskapitel)
https://aclanthology.org/W18-6319/ (Hinweis: siehe Buch/Slides) - Zhang* et al. (2019) – BERTScore: Evaluating Text Generation with BERT
https://arxiv.org/abs/1904.09675 - Rei* et al. (2020) – COMET: A Neural Framework for MT Evaluation
https://aclanthology.org/2020.emnlp-main.213/