Einfach erklärt

Interpretierbarkeit bedeutet: Man kann nachvollziehen, wie ein Modell zu seinen Vorhersagen kommt. Menschen sollen die wichtigen Gründe erkennen – etwa, welche Merkmale (Texte, Zahlen, Bildbereiche) den Ausschlag geben – und ob das sinnvoll ist.

Ganz einfache Beispiele:

• Kreditentscheidung: Man sieht, dass Einkommen und Schulden den Ausschlag gaben – nicht der Wohnort.
• Medizinische Einschätzung: Es ist erkennbar, welche Laborwerte/Bildbereiche zur Diagnose führten.
• Spam‑Filter: Es ist klar, welche Wörter/Absendermerkmale zur Einstufung „Spam“ geführt haben.

Professionelle Definition

Interpretierbarkeit bezeichnet den Grad, zu dem Ursache‑Wirkungs‑Beziehungen zwischen Eingaben, internen Repräsentationen und Ausgaben eines Modells für Menschen verständlich sind. Man unterscheidet:

• Intrinsisch interpretierbare Modelle: Modelle, deren Struktur selbst verständlich ist (z. B. kleine Entscheidungsbäume, lineare Modelle mit sparsamen Merkmalen, Regel‑/Score‑Modelle).
• Post‑hoc‑Methoden: Verfahren, die Erklärungen für komplexe Modelle liefern (lokal/global), z. B. Merkmals‑Attribution (SHAP, LIME), Gegenfaktische Erklärungen, Surrogat‑Modelle, Prototyp/Beispiel‑Erklärungen.

Abgrenzungen und Debatten:
• Interpretierbarkeit vs. Erklärbarkeit: Oft gemeinsam genutzt; teils wird „Interpretierbarkeit“ für modell‑inhärente Transparenz reserviert, „Erklärbarkeit“ für post‑hoc‑Erklärungen.
• Treue (Faithfulness): Erklärungen sollen dem echten Modellverhalten entsprechen.
• Austauschverhältnis Genauigkeit/Verständlichkeit: Nicht jedes interpretierbare Modell ist schwächer; es gibt hochleistungfähige interpretable Alternativen in einigen Bereichen.

Quellen

• Doshi‑Velez & Kim (2017) – Towards a Rigorous Science of Interpretable ML (Begriffe, Ziele, Bewertung)
https://arxiv.org/abs/1702.08608
https://arxiv.org/pdf/1702.08608

• Molnar (2022, laufend aktualisiert) – Interpretable Machine Learning (Freies Online‑Buch: Methoden, Beispiele)
https://christophm.github.io/interpretable-ml-book/

• Rudin (2019) – Stop Explaining Black Box ML Models for High‑Stakes Decisions (Argument für intrinsisch interpretierbare Modelle)
https://www.nature.com/articles/s42256-019-0048-x

• Lipton (2016) – The Mythos of Model Interpretability (Begriffsrahmen, Arten von Interpretierbarkeit)
https://arxiv.org/abs/1606.03490