Kurz gesagt: Data Analytics ist die systematische Auswertung von Daten, um Fragen zu beantworten, Ursachen zu verstehen und Entscheidungen zu verbessern/automatisieren. Man unterscheidet häufig:
- Descriptive (Was ist passiert?)
- Diagnostic (Warum ist es passiert?)
- Predictive (Was wird passieren?)
- Prescriptive (Was sollen wir tun?)
Mini‑Beispiele: Dashboard zu Umsatz & Retouren (descriptive), Funnel‑Analyse für Kaufabbrüche (diagnostic), Nachfrage‑Forecast (predictive), Preisempfehlung/Optimierung (prescriptive).
1) Abgrenzungen
- Business Intelligence (BI): Berichte/Dashboards, Monitoring, meist vergangenheitsbezogen.
- Data Analytics: Analysen von descriptive bis prescriptive inkl. Statistik, Hypothesen‑/Experimentdesign.
- Data Science: Umfasst Analytics + ML/Modellierung und oft Produktintegration.
- Machine Learning (ML): Datengetriebene Modelle zur Mustererkennung/Prognose (Teilgebiet der Data Science).
- MLOps/Analytics Engineering: Betrieb/Skalierung, Datenmodelle, Qualität, Automatisierung (ETL/ELT, CI/CD).
2) Prozessmodell (CRISP‑DM – modernisiert)
Iterativ mit enger Fach‑Einbindung:
- Business Understanding – Ziele/Fragen, KPIs, Erfolgskriterien.
- Data Understanding – Quellen, Zugang, erste Qualitätssicht, Explorative Analyse.
- Data Preparation – Bereinigung, Feature‑Engineering, Semantik (einheitliche Definitionen), Train/Test‑Splits.
- Modeling/Analysis – Statistik, ML, Regeln, Visual Analytics.
- Evaluation – Gütekriterien, Bias‑Checks, Robustheit, Gegencheck mit Fachseite.
- Deployment/Operations – Visualisierung, Reports, APIs/Batch‑Jobs, Monitoring & Drift‑Kontrollen.
Pipeline‑Sicht: Ingestion → Data Lake/Warehouse/Lakehouse → Transformation (ELT/ETL, z. B. dbt) → Semantische Schicht/Metrics Layer → BI/Apps/Modelle.
3) Datenqualität & Governance
- Qualitätsdimensionen: Richtigkeit, Vollständigkeit, Konsistenz, Aktualität, Eindeutigkeit, Validität.
- Metadaten/Lineage: Datenkatalog, Glossar, Herkunft (End‑to‑End‑Nachvollziehbarkeit), Verantwortlichkeiten (Data Stewardship).
- Zugriff/Schutz: Rollen, Least Privilege, Audit, Schlüsselmanagement, Pseudonymisierung/Anonymisierung.
- Compliance/Ethik: GDPR/DSGVO, EU Data Governance Act (DGA), EU Data Act, Schweiz: nDSG; DPIA/DSFA, Zweckbindung, Fairness/Transparenz.
4) Methoden (Auswahl)
Statistik/Hypothesen: Stichproben, Konfidenzintervalle, Signifikanztests, Regressionsmodelle, ANOVA, Zeitreihen (ARIMA/ETS), Bayes.
ML/Pattern‑Mining: Klassifikation (LogReg, Bäume, Ensembles), Regression (GLM, GBMs), Clustering (k‑Means/DBSCAN), Dimensionalität (PCA/UMAP), Anomalieerkennung, Empfehlungssysteme.
Causal & Experimente: A/B‑Tests, Power‑Analyse, Randomisierung/Stratifizierung; Quasi‑Experimente (Diff‑in‑Diff, Matching); Instrumentvariablen.
Visual Analytics: Diagrammwahl, Ausreißer/Trends, Interaktive Filter; Daten‑Storytelling (Message‑first, klare Captions, Kontext).
5) Metriken & Validierung
- Klassifikation: Accuracy, Precision, Recall, F1, ROC‑AUC, PR‑AUC.
- Regression/Forecasts: RMSE, MAE, (s)MAPE, MASE; saisonale/kalenderbedingte Effekte beachten.
- Experimente: Effektgröße/Lift, p‑Wert & Konfidenzintervalle, Fehler 1./2. Art, Stopp‑Regeln.
- Datenqualität: DQ‑SLOs (z. B. „<0,5 % Nullwerte in ‚customer_id‘“), automatisierte Tests in Pipelines.
6) Plattform & Werkzeuge (neutral)
- Sprachen/Abfragen: SQL, Python (pandas, statsmodels, scikit‑learn), R (tidyverse).
- Speicher: Data Warehouse, Data Lake, Lakehouse (Spaltenformate, z. B. Parquet); OLAP‑Semantik/Metric‑Layer.
- Transformation/Orchestrierung: ELT/ETL, Orchestrierung (z. B. Airflow), dbt‑Style Tests.
- Analyse/Dev: Notebooks (Jupyter), IDEs, Git/DVC für Versionierung/Reproduzierbarkeit.
- BI/Visualisierung: Dashboards, Self‑Service mit Governance (Freigabe‑/Review‑Prozess).
- Monitoring: Daten‑/Modell‑Drift, Alerting, Kosten/Performance.
7) Quick‑Start für KMU (30/60/90 Tage)
Tag 0–30
- 5–7 Kern‑KPIs definieren (z. B. Umsatz, Deckungsbeitrag, Churn, NPS).
- Datenquellen anbinden; Datenkatalog + Glossar starten.
- Ein Executive‑Dashboard (descriptive) mit QA‑Checks.
Tag 31–60
- Gemeinsames Datenmodell (Sternschema) für Vertrieb/Marketing/Operations.
- Qualitäts‑Tests in Pipeline (Eindeutigkeit, Datentypen, Referenzschlüssel).
- 1 A/B‑Test sauber aufsetzen (Hypothese, Power, Metriken, Stopp‑Regeln).
Tag 61–90
- 1 Predictive Use‑Case (z. B. Churn/Forecast) PoC → Shadow‑Mode → limited Rollout.
- Daten‑/Modell‑Monitoring + Runbook (Alarme, Rollback, Re‑Train).
- Governance‑Review (Zweckbindung, Rechtsgrundlage, DPIA/DSFA, Zugriffe).
8) Typische Use‑Cases
- Sales/Marketing: Lead‑Scoring, Attributionsmodelle, Kundensegmentierung, Next‑Best‑Action.
- Operations: Bestands‑/Bedarfs‑Forecasting, Routen‑/Personal‑Optimierung, Qualitätskontrolle.
- Finance/Risk: Betrugserkennung, Cash‑Forecast, Kredit‑Scoring.
- Produkt: Feature‑Nutzung, Churn‑Frühwarnung, Experiment‑Plattform.
Quellen
Prozess & Grundlagen
- CRISP‑DM – IBM/SPSS Überblick: https://www.ibm.com/docs/en/spss-modeler/SaaS?topic=dm-crisp
(Historisches Handbuch CRISP‑DM 1.0, 1999 – weit verbreitet) - NIST Big Data (NBD‑PWG): https://www.nist.gov/itl/big-data
NBDIF Vol. 1–10 (Architektur/Vokabular/Use‑Cases): https://www.nist.gov/programs-projects/nist-big-data-interoperability-framework
Datenqualität & Governance
- ISO/IEC 25012:2008 – Data Quality Model: httphttps://www.iso.org/standard/35736.htmls://www.iso.org/standard/35736.html
- ISO 8000 – Data Quality (Reihe/Überblick): https://www.iso.org/committee/54956/x/catalogue/
- EU GDPR/DSGVO: https://gdpr.eu/
- EU Data Governance Act (DGA) – gilt seit 24.09.2023: https://digital-strategy.ec.europa.eu/en/policies/data-governance-act
- EU Data Act – in Kraft seit 11.01.2024, anwendbar ab 12.09.2025: https://digital-strategy.ec.europa.eu/en/library/data-act
- Schweiz – nDSG (FADP): https://www.fedlex.admin.ch/eli/cc/2022/491/en