Interpretierbare Modelle (z. B. LIME, SHAP, Saliency Maps)

Einfach erklärt

Interpretierbare Modelle machen sichtbar und verständlich, warum ein System eine bestimmte Vorhersage trifft. Entweder ist das Modell selbst leicht zu verstehen (z. B. ein kleiner Entscheidungsbaum) – oder wir liefern Erklärungen im Nachhinein (post‑hoc), etwa welche Merkmale am wichtigsten waren oder welche Bildbereiche ausschlaggebend sind.

Ganz einfache Beispiele:

• Tabellendaten: Eine Erklärung zeigt: „Einkommen und Schulden gaben den Ausschlag – Wohnort spielte kaum eine Rolle.“
• Bild: Eine Hervorhebung (Heatmap) markiert die Bildteile, die zur Klassifikation „Katze“ geführt haben (z. B. die Ohren/Schnauze).
• Text: Wörter werden farbig markiert, die besonders für oder gegen „Spam“ sprachen.

Professionelle Definition

Interpretierbare Modelle und post‑hoc‑Erklärungsmethoden zielen darauf, Beiträge von Eingabemerkmalen oder Teilstrukturen zur Modellvorhersage transparent zu machen. Wichtige Klassen/Beispiele:

• Intrinsisch interpretierbar: Kleine Entscheidungsbäume, lineare/Logit‑Modelle mit wenigen, verständlichen Merkmalen; Regel‑/Score‑Modelle.
• Lokal, modell‑agnostisch: LIME erzeugt um eine konkrete Instanz synthetische Nachbarn und trainiert dort ein einfaches lokales Modell (z. B. Lasso), dessen Koeffizienten als Merkmalsbeiträge dienen.
• Additive Attributionsmethoden: SHAP ordnet jedem Merkmal einen Beitrag nach Shapley‑Werten zu (lokal additiv, konsistente Axiome); aggregierbar zu globalen Wichtigkeiten/Interaktionen.
• Saliency/Gradienten‑basierte Karten: Z. B. Saliency Maps (Ableitung der Ausgabe nach dem Pixel), Integrated Gradients, SmoothGrad; heben relevante Regionen hervor, v. a. in Bildern.

Hinweise/Abwägungen:
• Treue vs. Verständlichkeit: Post‑hoc‑Erklärungen sind Annäherungen und können von der echten Modelllogik abweichen.
• Stabilität/Robustheit: Erklärungen sollen reproduzierbar sein; Gradientenmethoden werden oft geglättet (z. B. SmoothGrad).
• Datenschutz & Fairness: Erklärungen dürfen sensible Merkmale nicht ausplaudern; zugleich helfen sie, Bias aufzudecken.

Quellen

  1. Ribeiro, Singh, Guestrin (2016) – “Why Should I Trust You?”: LIME (lokale modell‑agnostische Erklärungen)
    https://www.kdd.org/kdd2016/papers/files/rfp0573-ribeiroA.pdf
  2. Lundberg & Lee (2017) – SHAP: A Unified Approach to Interpreting Model Predictions
    https://proceedings.neurips.cc/paper/7062-a-unified-approach-to-interpreting-model-predictions.pdf
  3. Simonyan, Vedaldi, Zisserman (2013) – Deep Inside Convolutional Networks: Visualising Image Classification Models (Saliency Maps)
    https://arxiv.org/abs/1312.6034
    https://arxiv.org/pdf/1312.6034
  4. Smilkov et al. (2017) – SmoothGrad: removing noise by adding noise (stabilisierte Saliency)
    https://arxiv.org/abs/1706.03825
    https://arxiv.org/pdf/1706.03825
  5. Molnar – Interpretable Machine Learning (freies Online‑Buch, Methodenüberblick)
    https://christophm.github.io/interpretable-ml-book/