Einfach erklärt
Recall (Trefferquote) sagt: Von allen wirklich positiven Fällen – wie viele hat das Modell gefunden?
Je weniger Übersehen, desto höher der Recall.
Kurz: Recall hoch = kaum verpasste Positive.
Ganz einfache Beispiele (mit Alltagsbildern)
• Spam‑Filter: Von aller Spam‑Post – wie viel landet wirklich im Spam‑Ordner? Rutscht viel durch → niedriger Recall.
• Krebs‑Screening: Von allen tatsächlich Kranken – wie viele markiert der Test als auffällig? Viele Übersehene → niedriger Recall.
• Schatzsuche im Lager: Wie viele der gesuchten Teile wurden am Ende gefunden? Wenn vieles fehlt → niedriger Recall.
Professionelle Definition (verständlich)
Bei binärer Klassifikation:
- True Positive (TP): korrekt als positiv erkannt.
- False Negative (FN): positiv, aber nicht erkannt (übersehen).
Recall = TP / (TP + FN).
Er misst die Vollständigkeit der gefundenen Positiven.
Wichtige Hinweise:
- Trade‑off mit Precision: Höherer Recall gelingt oft, wenn man großzügiger entscheidet (niedrige Schwelle) – dann steigt häufig die Zahl falscher Positive (Precision sinkt).
- Klassengewicht / Imbalance: Recall ist hilfreich, wenn Positive selten sind und Übersehen teuer wäre.
Mehrklassen / Multilabel:
- Macro‑Recall: Mittel der Recall‑Werte je Klasse (alle gleich gewichtet).
- Weighted‑Recall: wie Macro, aber nach Klassenhäufigkeit gewichtet.
- Micro‑Recall: zählt TP/FN global über alle Klassen – entspricht dem Recall aus aggregierten Zahlen.
Praxis‑Tipps
- Wenn Übersehen kritisch ist (z. B. Betrug, Krankheit, Sicherheitsalarm), optimiere Recall oder setze eine niedrigere Schwelle.
- Zusammen mit Precision betrachten (und ggf. F1), um Balance zu halten.
- Mit PR‑Kurve und PR‑AUC prüfen, wie sich Recall und Precision über Schwellen verhalten.
- Kalibrierte Wahrscheinlichkeiten helfen, Schwellen sinnvoll zu setzen.
Quellen
- Wikipedia – Precision and recall (Definitionen, Beispiele)
https://en.wikipedia.org/wiki/Precision_and_recall - scikit‑learn – Precision, Recall and F‑measure
https://scikit-learn.org/stable/modules/model_evaluation.html#precision-recall-f-measure-metrics - Saito & Rehmsmeier (2015) – The Precision‑Recall Plot is more informative than the ROC Plot when evaluating binary classifiers on imbalanced datasets
https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0118432 - Manning, Raghavan, Schütze (2008) – Introduction to Information Retrieval (Evaluation‑Kapitel)
https://nlp.stanford.edu/IR-book/ - Powers (2011) – Evaluation: Precision, Recall, F‑measure and Accuracy
https://link.springer.com/article/10.1007/s10791-011-9179-5