Einfach erklärt

ROUGE misst, wie gut eine Zusammenfassung oder ein generierter Text die wichtigen Teile der Referenz wiedertrifft. Statt nur Wort-für-Wort zu prüfen, zählt ROUGE z. B. überlappende Wortfolgen oder geteilte Wörter.

Kurz: Je mehr inhaltliche Überschneidung mit der Referenz, desto höher der ROUGE‑Wert.

Ganz einfache Beispiele (mit Alltagsbildern)

Stichwort‑Liste: Du fasst einen Artikel zusammen. Wenn deine Stichwörter mit denen der Vorlage stark überlappen, ist ROUGE hoch (ROUGE‑1/ROUGE‑L).
Satz‑Bausteine: Hast du viele gleiche Wortfolgen wie die Vorlage (z. B. Zweier‑Wortfolgen wie „neue Studie“, „zeigt dass“)? Dann ist ROUGE‑2 hoch.
Gliederung/Struktur: ROUGE‑L achtet auf die längste gemeinsame Folge von Wörtern – ähnlich, als würdest du prüfen, ob deine Erzählreihenfolge der Vorlage folgt.

Professionelle Definition (verständlich)

Familie von Kennzahlen für Text‑Überlappung zwischen Hypothese und Referenz(en). Häufige Varianten:

  • ROUGE‑N (z. B. N=1,2): Recall (oft), Precision und F1 der n‑Gram‑Überlappung.
  • ROUGE‑L: Nutzt die Longest Common Subsequence (LCS), misst damit sequenzielle Übereinstimmung (Recall/Precision/F1).
  • ROUGE‑SU: Berücksichtigt Skip‑Bigrams (Wortpaare mit Lücken) plus Unigramme.

Interpretation:

  • Recall‑lastig (klassisch): „Wie viel der wichtigen Inhalte der Referenz taucht in meiner Hypothese auf?“
  • F1 kombiniert Trefferquote und Genauigkeit (häufig berichtet).

Praxis‑Wichtige Details:

  • Mehrere Referenzen geben stabilere Werte.
  • Tokenisierung/Normalisierung (Kleinbuchstaben, Satzzeichen) beeinflussen ROUGE → konsistente Evaluation‑Pipelines nutzen (z. B. py‑rouge, rouge‑score, sacreROUGE).
  • Grenzen: Zählt Form‑Überschneidung, nicht Bedeutung. Synonyme/Paraphrasen können unterbewertet sein → ergänze mit menschlicher Bewertung oder semantischen Metriken (BERTScore, COMET für MT, QuestEval für Summarization).

Quellen

  1. Lin (2004) – ROUGE: A Package for Automatic Evaluation of Summaries
    https://aclanthology.org/W04-1013/
  2. Lin (2003) – Automatic Evaluation of Summaries Using n‑gram Co‑occurrence Statistics
    https://aclanthology.org/N03-1020/
  3. Google Research – rouge‑score (Implementierung/Anleitung)
    https://github.com/google-research/google-research/tree/master/rouge
  4. Peyrard (2019) – A Principled Framework for Evaluation in Summarization (Kritik & Perspektiven)
    https://arxiv.org/abs/1907.01272
  5. Post (2018) – A Call for Clarity in Reporting BLEU Scores (sacreBLEU) – Hinweise zu Reproduzierbarkeit (analog: sacreROUGE)
    https://aclanthology.org/W18-6319/
  6. Deutsch, Roth, Upadhyay (2021) – SacreROUGE: An Open‑Source Library for Summarization Evaluation
    https://aclanthology.org/2021.naacl-demo.21/