Einfach erklärt

Precision (Genauigkeit der Treffer) sagt: Von allem, was das Modell als „positiv“ meldet – wie viel davon ist wirklich positiv?
Je weniger Fehlalarme, desto höher die Precision.

Kurz: Precision hoch = kaum falsche Positive.

Ganz einfache Beispiele (mit Alltagsbildern)

Spam‑Ordner: Von den Mails im Spam‑Ordner – wie viele sind wirklich Spam (und nicht wichtige Mails)? Viele Fehlalarme → niedrige Precision.
Rauchmelder: Wenn er losgeht, brennt es wirklich? Piept er oft ohne Feuer, ist die Precision schlecht.
Hausarzt‑Überweisung: Wenn der Arzt eine Überweisung zum Spezialisten ausstellt – wie oft war das berechtigt? Viele unnötige Überweisungen → niedrige Precision.

Professionelle Definition (verständlich)

Bei binärer Klassifikation:

  • True Positive (TP): korrekt als positiv erkannt.
  • False Positive (FP): fälschlich als positiv markiert.

Precision = TP / (TP + FP).
Sie misst die Reinheit der positiven Vorhersagen.

Wichtige Hinweise:

  • Trade‑off mit Recall: Höhere Precision erreicht man oft, indem man strenger entscheidet (höhere Schwelle) – dann sinkt häufig der Recall.
  • Klassenungleichgewicht: Precision bleibt aussagekräftig, auch wenn es viel mehr Negative als Positive gibt.
  • Precision‑Recall‑Kurve: Zeigt, wie sich Precision und Recall bei verschiedenen Schwellen verhalten; PR‑AUC fasst das zusammen.

Mehrklassen / Multilabel:

  • Macro‑Precision: Mittel der Precision‑Werte je Klasse (alle Klassen gleich gewichtet).
  • Weighted‑Precision: wie Macro, aber nach Klassenhäufigkeit gewichtet.
  • Micro‑Precision: bildet TP/FP global über alle Klassen – entspricht der globalen Precision.

Praxis‑Tipps

  • Wenn Fehlalarme teuer sind (z. B. falsche Betrugswarnung, Fehlalarm in der Leitstelle), optimiere Precision oder setze eine hohe Schwelle.
  • Prüfe immer zusammen mit Recall (und ggf. F1), damit du Balance hältst.
  • Nutze Kalibrierung (Platt/Isotonic), wenn du zusätzlich verlässliche Wahrscheinlichkeiten brauchst.

Quellen

  1. Wikipedia – Precision and recall (Definitionen, Beispiele)
    https://en.wikipedia.org/wiki/Precision_and_recall
  2. scikit‑learn – Precision, Recall and F‑measure
    https://scikit-learn.org/stable/modules/model_evaluation.html#precision-recall-f-measure-metrics
  3. Saito & Rehmsmeier (2015) – The Precision‑Recall Plot is more informative than the ROC Plot when evaluating binary classifiers on imbalanced datasets
    https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0118432
  4. Manning, Raghavan, Schütze (2008) – Introduction to Information Retrieval (Evaluation‑Kapitel)
    https://nlp.stanford.edu/IR-book/
  5. Powers (2011) – Evaluation: Precision, Recall, F‑measure and Accuracy
    https://link.springer.com/article/10.1007/s10791-011-9179-5