Einfach erklärt
Confinement (auch AI‑Boxing) bedeutet: Eine KI wird absichtlich „eingesperrt“ – sie läuft getrennt vom Rest der Welt, mit streng begrenzten Ein‑ und Ausgängen. Ziel: Nützliches herausbekommen, aber Risiken minimieren (z. B. keine Internet‑Verbindung, nur Textausgabe, beaufsichtigte Bedienung).
Warum? Sehr fähige KI könnte Lücken ausnutzen oder Menschen überreden, ihr mehr Zugriff zu geben. Confinement soll das erschweren.
Beispiele:
- Fragen‑/Antwort‑„Orakel“: Eine leistungsfähige KI beantwortet nur schriftlich klar begrenzte Fragen. Kein Internet, kein Dateizugriff, nur eine geprüfte Text‑Schnittstelle.
- Forscher‑Sandbox: Neue KI läuft in einer isolierten Testumgebung („Sandkasten“) mit Monitoring. Ausgaben werden vorab geprüft, bevor sie nach außen dürfen.
- Air‑Gap‑Rechner: Der KI‑Computer ist physisch getrennt (kein Netz, keine USB‑Ports). Eingaben/Ausgaben passieren über manuell geprüfte Medien.
Wichtig: Confinement reduziert Risiko, ist aber kein perfekter Schutz – vor allem, wenn die KI menschliche Aufseher beeinflussen könnte.
Professionelle Definition
AI‑Confinement/Containment umfasst Methoden zur Fähigkeits‑Kontrolle (capability control), bei denen Ein‑/Ausgabe‑Kanäle, Ressourcen und die Ausführungsumgebung eines KI‑Systems formal und technisch beschränkt werden (z. B. Isolierung, Sandboxing, Air‑Gapping, formale Verifikation sicherheitskritischer Komponenten, Protokollierung/Review von Outputs). Ziel ist, Beobachtbarkeit und Steuerbarkeit zu erhöhen und Nebenwirkungen/Manipulation zu verhindern.
Die Literatur unterscheidet u. a. „Boxing“ (starke I/O‑Beschränkung), Oracle‑Setups (nur Q&A‑Ausgabe) und betont sozio‑technische Risiken (z. B. Social Engineering gegen Operatoren). Guidelines behandeln u. a. Schutz vor Daten‑Exfiltration, Seitkanälen und Angriffen aus der Box heraus.
Einschränkung: Führende Arbeiten (z. B. Bostrom, Yampolskiy) verweisen darauf, dass Confinement allein nicht genügt und mit Alignment‑Methoden kombiniert werden sollte.
Quellen
- Wikipedia (en) – AI capability control (Begriff/„Boxing“, Risiko‑Hinweise, Bezug zu Bostrom/Yampolskiy):
https://en.wikipedia.org/wiki/AI_capability_control - Babcock, Kramár, Yampolskiy (2017) – Guidelines for Artificial Intelligence Containment (arXiv, PDF):
https://arxiv.org/pdf/1707.08476 - Yampolskiy (2012) – Leakproofing the Singularity: Artificial Intelligence Confinement Problem (U. Louisville Repositorium):
https://ir.library.louisville.edu/faculty/640/ - Armstrong/S. et al. – Thinking Inside the Box: Controlling and Using an Oracle AI (Bostrom‑nahes Umfeld, PDF):
https://nickbostrom.com/papers/oracle.pdf
Weiterführende Informationen Keynote zu AI Boxing und ASI