Einfach erklärt
ROUGE misst, wie gut eine Zusammenfassung oder ein generierter Text die wichtigen Teile der Referenz wiedertrifft. Statt nur Wort-für-Wort zu prüfen, zählt ROUGE z. B. überlappende Wortfolgen oder geteilte Wörter.
Kurz: Je mehr inhaltliche Überschneidung mit der Referenz, desto höher der ROUGE‑Wert.
Ganz einfache Beispiele (mit Alltagsbildern)
• Stichwort‑Liste: Du fasst einen Artikel zusammen. Wenn deine Stichwörter mit denen der Vorlage stark überlappen, ist ROUGE hoch (ROUGE‑1/ROUGE‑L).
• Satz‑Bausteine: Hast du viele gleiche Wortfolgen wie die Vorlage (z. B. Zweier‑Wortfolgen wie „neue Studie“, „zeigt dass“)? Dann ist ROUGE‑2 hoch.
• Gliederung/Struktur: ROUGE‑L achtet auf die längste gemeinsame Folge von Wörtern – ähnlich, als würdest du prüfen, ob deine Erzählreihenfolge der Vorlage folgt.
Professionelle Definition (verständlich)
Familie von Kennzahlen für Text‑Überlappung zwischen Hypothese und Referenz(en). Häufige Varianten:
- ROUGE‑N (z. B. N=1,2): Recall (oft), Precision und F1 der n‑Gram‑Überlappung.
- ROUGE‑L: Nutzt die Longest Common Subsequence (LCS), misst damit sequenzielle Übereinstimmung (Recall/Precision/F1).
- ROUGE‑SU: Berücksichtigt Skip‑Bigrams (Wortpaare mit Lücken) plus Unigramme.
Interpretation:
- Recall‑lastig (klassisch): „Wie viel der wichtigen Inhalte der Referenz taucht in meiner Hypothese auf?“
- F1 kombiniert Trefferquote und Genauigkeit (häufig berichtet).
Praxis‑Wichtige Details:
- Mehrere Referenzen geben stabilere Werte.
- Tokenisierung/Normalisierung (Kleinbuchstaben, Satzzeichen) beeinflussen ROUGE → konsistente Evaluation‑Pipelines nutzen (z. B. py‑rouge, rouge‑score, sacreROUGE).
- Grenzen: Zählt Form‑Überschneidung, nicht Bedeutung. Synonyme/Paraphrasen können unterbewertet sein → ergänze mit menschlicher Bewertung oder semantischen Metriken (BERTScore, COMET für MT, QuestEval für Summarization).
Quellen
- Lin (2004) – ROUGE: A Package for Automatic Evaluation of Summaries
https://aclanthology.org/W04-1013/ - Lin (2003) – Automatic Evaluation of Summaries Using n‑gram Co‑occurrence Statistics
https://aclanthology.org/N03-1020/ - Google Research – rouge‑score (Implementierung/Anleitung)
https://github.com/google-research/google-research/tree/master/rouge - Peyrard (2019) – A Principled Framework for Evaluation in Summarization (Kritik & Perspektiven)
https://arxiv.org/abs/1907.01272 - Post (2018) – A Call for Clarity in Reporting BLEU Scores (sacreBLEU) – Hinweise zu Reproduzierbarkeit (analog: sacreROUGE)
https://aclanthology.org/W18-6319/ - Deutsch, Roth, Upadhyay (2021) – SacreROUGE: An Open‑Source Library for Summarization Evaluation
https://aclanthology.org/2021.naacl-demo.21/