Einfach erklärt

Recall (Trefferquote) sagt: Von allen wirklich positiven Fällen – wie viele hat das Modell gefunden?
Je weniger Übersehen, desto höher der Recall.

Kurz: Recall hoch = kaum verpasste Positive.

Ganz einfache Beispiele (mit Alltagsbildern)

Spam‑Filter: Von aller Spam‑Post – wie viel landet wirklich im Spam‑Ordner? Rutscht viel durch → niedriger Recall.
Krebs‑Screening: Von allen tatsächlich Kranken – wie viele markiert der Test als auffällig? Viele Übersehene → niedriger Recall.
Schatzsuche im Lager: Wie viele der gesuchten Teile wurden am Ende gefunden? Wenn vieles fehlt → niedriger Recall.

Professionelle Definition (verständlich)

Bei binärer Klassifikation:

  • True Positive (TP): korrekt als positiv erkannt.
  • False Negative (FN): positiv, aber nicht erkannt (übersehen).

Recall = TP / (TP + FN).
Er misst die Vollständigkeit der gefundenen Positiven.

Wichtige Hinweise:

  • Trade‑off mit Precision: Höherer Recall gelingt oft, wenn man großzügiger entscheidet (niedrige Schwelle) – dann steigt häufig die Zahl falscher Positive (Precision sinkt).
  • Klassengewicht / Imbalance: Recall ist hilfreich, wenn Positive selten sind und Übersehen teuer wäre.

Mehrklassen / Multilabel:

  • Macro‑Recall: Mittel der Recall‑Werte je Klasse (alle gleich gewichtet).
  • Weighted‑Recall: wie Macro, aber nach Klassenhäufigkeit gewichtet.
  • Micro‑Recall: zählt TP/FN global über alle Klassen – entspricht dem Recall aus aggregierten Zahlen.

Praxis‑Tipps

  • Wenn Übersehen kritisch ist (z. B. Betrug, Krankheit, Sicherheitsalarm), optimiere Recall oder setze eine niedrigere Schwelle.
  • Zusammen mit Precision betrachten (und ggf. F1), um Balance zu halten.
  • Mit PR‑Kurve und PR‑AUC prüfen, wie sich Recall und Precision über Schwellen verhalten.
  • Kalibrierte Wahrscheinlichkeiten helfen, Schwellen sinnvoll zu setzen.

Quellen

  1. Wikipedia – Precision and recall (Definitionen, Beispiele)
    https://en.wikipedia.org/wiki/Precision_and_recall
  2. scikit‑learn – Precision, Recall and F‑measure
    https://scikit-learn.org/stable/modules/model_evaluation.html#precision-recall-f-measure-metrics
  3. Saito & Rehmsmeier (2015) – The Precision‑Recall Plot is more informative than the ROC Plot when evaluating binary classifiers on imbalanced datasets
    https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0118432
  4. Manning, Raghavan, Schütze (2008) – Introduction to Information Retrieval (Evaluation‑Kapitel)
    https://nlp.stanford.edu/IR-book/
  5. Powers (2011) – Evaluation: Precision, Recall, F‑measure and Accuracy
    https://link.springer.com/article/10.1007/s10791-011-9179-5