Einfach erklärt
Anomaly Detection (Anomalieerkennung) bezeichnet Verfahren, mit denen ungewöhnliche, seltene oder auffällige Beobachtungen in Daten gefunden werden sollen – also Punkte, Ereignisse oder Muster, die nicht zum typischen Normalverhalten passen.
Typisches Bild: Man hat viele Datenpunkte, von denen die meisten „normal“ sind (z. B. reguläre Transaktionen, normale Maschinenzustände, üblicher Netzwerkverkehr). Anomaly-Detection-Methoden versuchen, genau die wenigen Beobachtungen zu finden, die deutlich aus der Masse herausfallen – weil sie z. B. auf Betrug, Defekte oder Angriffe hinweisen können.
Beispiele
- Kreditkartenbetrug
Die allermeisten Transaktionen einer Person sind unauffällig. Ein plötzlich sehr hoher Betrag, an einem ungewohnten Ort, zu einer ungewöhnlichen Zeit kann als Anomalie markiert werden und eine Betrugsprüfung auslösen. - Maschinen- und Anlagenüberwachung
Sensoren an einer Maschine liefern kontinuierlich Temperatur-, Vibrations- oder Druckwerte. Weicht ein Messverlauf stark vom typischen Normalmuster ab, kann ein beginnender Defekt oder ein drohender Ausfall vorliegen. - Cyber-Security & Intrusion Detection
Ein Netzwerk- oder Host-IDS lernt, wie normales Nutzungsverhalten aussieht. Plötzlich stark ansteigender Datenverkehr, ungewöhnliche Ports oder seltsame Prozessketten werden als Anomalien erkannt und können Hinweise auf Angriffe oder Malware geben. - Medizin & Health Monitoring
Ungewöhnliche Muster in EKG-Signalen, Laborwertverläufen oder Vitaldaten können als Anomalien auf akute Probleme oder seltene Krankheitsbilder hinweisen. - Datenqualität & Monitoring
In Datenpipelines werden Anomalien (z. B. plötzliche Sprünge in Metriken, unplausible Wertebereiche) genutzt, um Datenfehler frühzeitig zu erkennen.
Professionelle Definition
In der Datenanalyse und im Machine Learning wird unter Anomaly Detection allgemein die Identifikation von seltenen Items, Ereignissen oder Beobachtungen verstanden, die signifikant von der Mehrheit der Daten abweichen und nicht einer gut definierten Normalverteilung entsprechen. Solche Beobachtungen werden je nach Kontext als Anomalien, Ausreißer, Ausnahmen, „novel events“ oder „irregular patterns“ bezeichnet.
Formal betrachtet geht es darum, in einem Datenraum Regionen zu identifizieren, in denen die Dichte oder Wahrscheinlichkeit der Daten sehr gering ist – oder in denen Beobachtungen nicht mit einem gelernten Modell des Normalverhaltens vereinbar sind. Anomaly Detection ist damit ein zentrales Teilgebiet der unsupervised, semi-supervised und gelegentlich supervised Lernverfahren.
Typische Arten von Anomalien
In der Literatur werden u. a. folgende Typen unterschieden:
- Punktanomalien (point anomalies)
Einzelne Datenpunkte, die isoliert betrachtet ungewöhnlich sind (z. B. ein extrem hoher Transaktionswert). - Kontextuelle Anomalien (contextual anomalies)
Beobachtungen, die nur im jeweiligen Kontext auffällig sind (z. B. normale Temperaturwerte, die aber für eine bestimmte Tageszeit oder einen bestimmten Betriebsmodus ungewöhnlich sind). - Kollektive Anomalien (collective anomalies)
Gruppen von Punkten oder ganze Sequenzen, die in ihrer Gesamtheit ungewöhnliche Muster zeigen (z. B. eine Sequenz von Netzwerkpaketen, die zusammen einen Angriff repräsentieren, obwohl jedes Paket für sich genommen unauffällig wirkt).
Typische Merkmale und Methodenklassen
Anomaly Detection lässt sich nach verschiedenen Kriterien gliedern:
- Nach dem Lernparadigma
- Unsupervised Anomaly Detection: nur un-gelabelte Daten, das Modell sucht selbst seltene oder „einsame“ Punkte.
- Semi-Supervised / Novelty Detection: das Modell wird auf Normaldaten trainiert und markiert Abweichungen im Einsatz als Anomalien.
- Supervised Anomaly Detection: es liegen explizite Labels für Normalfälle und Anomalien vor (z. B. Fraud / kein Fraud).
- Nach dem Modellansatz (Auswahl wichtiger Klassen):
- Statistische Methoden: z. B. z-Score, parametrische und nicht-parametrische Dichte-Schätzungen, robuste Statistik.
- Distanz- und dichtebasierte Verfahren: k-NN-basierte Outlier Scores, Local Outlier Factor (LOF), weitere Density-based-Methoden.
- Clusterbasierte Verfahren: Punkte, die keiner sinnvollen Clusterstruktur angehören oder weit entfernt von Clustern liegen.
- One-Class- und Boundary-Methoden: One-Class SVM, SVDD, One-Class Neural Networks, Isolationsforst (Isolation Forest).
- Rekonstruktionsbasierte Methoden: Autoencoder, Variational Autoencoder, andere neuronale Netze, bei denen ein hoher Rekonstruktionsfehler auf Anomalien hindeutet.
- Ensemble-Verfahren: Kombination verschiedener Outlier-Detektoren zur robusteren Erkennung.
- Nach dem Datenformat
Zeitreihen, Graphdaten, Bilddaten, Textdaten, Tabellendaten usw. benötigen oft speziell angepasste Anomaly-Detection-Verfahren.
Anwendungsfälle
- Finanz- und Zahlungsverkehr
Betrugserkennung (Fraud Detection) in Kreditkartenzahlungen, Online-Banking, Versicherungen, Trading. - IT- und Netzwerksicherheit
Intrusion Detection Systems (IDS), Network Behavior Anomaly Detection (NBAD), Host-basierte Anomalieerkennung, Erkennung von Zero-Day-Angriffen. - Industrie & IoT
Predictive Maintenance, Monitoring von Maschinen, Anlagen, Robotern und vernetzten IoT-Geräten. - Healthcare & Medizin
Erkennung seltener Ereignisse oder Auffälligkeiten in medizinischen Bildern, klinischen Daten und Monitoring-Systemen. - Web- & Nutzungsanalytik
Erkennung ungewöhnlicher Traffic-Spitzen, Bot-Verhalten, Missbrauch von APIs, untypischer Nutzungsmuster. - Datenqualität & Metrik-Monitoring
Monitoring von KPIs, Geschäftsmetriken und Datenpipelines zur frühzeitigen Erkennung von Problemen.
Grenzen und Herausforderungen
- Keine universell beste Methode
Studien zeigen, dass es in der Praxis kaum „die eine“ Anomaly-Detection-Methode gibt, die auf allen Datensätzen überlegen ist – die Wahl hängt stark von Daten und Anwendung ab. - Parameter- und Schwellenwert-Sensitivität
Viele Algorithmen benötigen sorgfältig gewählte Parameter (z. B. Nachbarschaftsgröße, Kontaminationsrate). Falsch gesetzte Schwellen können zu vielen False Positives oder False Negatives führen. - Konzeptdrift & sich änderndes Normalverhalten
Wenn sich das System oder das Nutzerverhalten im Zeitverlauf ändert, muss das Normalmodell aktualisiert werden, damit dauerhafte Veränderungen nicht ständig als Anomalie markiert werden. - Skalierung & Rechenaufwand
Große, hochdimensionale Daten erfordern skalierbare Verfahren und effiziente Implementierungen. - Erklärbarkeit
Besonders bei komplexen ML- oder Deep-Learning-Modellen ist es schwierig, den Grund für die Einstufung als Anomalie transparent zu machen – für viele Domänen (z. B. Sicherheit, Medizin, Compliance) aber entscheidend.
Verhältnis zu verwandten Begriffen
- Outlier Detection / Ausreißererkennung
Wird in vielen Quellen weitgehend synonym zu Anomaly Detection verwendet. In manchen Kontexten bezeichnet Outlier Detection eher das Auffinden seltener Punkte innerhalb eines Datensatzes, während Anomaly Detection breiter auch operative Überwachung umfasst. - Novelty Detection
Fokus speziell auf das Erkennen neuer Muster, nachdem ein Modell auf Normaldaten trainiert wurde. Novelty Detection wird häufig als semi-supervised Spezialfall der Anomalieerkennung beschrieben. - Zero-Day-Erkennung
Anwendungsfall aus der IT-Sicherheit: Erkennung zuvor unbekannter Angriffe oder Exploits. Setzt meist Anomaly-Detection- und Verhaltensanalysen ein, um neuartige Bedrohungen ohne bekannte Signaturen zu erkennen. - Open-Set Recognition & Out-of-Distribution Detection
Verwandte Probleme, bei denen Modelle auch erkennen sollen, dass Eingaben nicht zu bekannten Klassen oder zur Trainingsverteilung gehören.
Quellen
- IBM – „Machine Learning for Anomaly Detection“
https://www.ibm.com/think/topics/machine-learning-for-anomaly-detection (ibm.com) - GeeksforGeeks – „Machine Learning for Anomaly Detection“
https://www.geeksforgeeks.org/machine-learning/machine-learning-for-anomaly-detection/ (geeksforgeeks.org) - Coursera – „What Is Anomaly Detection in Machine Learning?“
https://www.coursera.org/articles/anomaly-detection-machine-learning (coursera.org) - scikit-learn – „2.7. Novelty and Outlier Detection“
https://scikit-learn.org/stable/modules/outlier_detection.html (scikit-learn.org)