KI-Sicherheit (AI Safety)
Interdisziplinäres Forschungs- und Praxisfeld, das darauf abzielt, KI-Systeme so zu entwickeln und zu betreiben, dass sie ihre intendierten Ziele zuverlässig, robust und ohne schädliche Nebenwirkungen erfüllen.
Definition
KI-Sicherheit (AI Safety) ist das interdisziplinäre Forschungs- und Praxisfeld, das darauf abzielt, KI-Systeme so zu entwickeln und zu betreiben, dass sie ihre intendierten Ziele zuverlässig, robust und ohne schädliche Nebenwirkungen erfüllen. Der Begriff stammt aus der KI-Forschung der späten 2000er Jahre, wurde durch Arbeiten von Stuart Russell, Nick Bostrom und Eliezer Yudkowsky popularisiert und ist heute fester Bestandteil der Strategien aller grossen KI-Labs.
AI Safety umfasst technische Robustheit, Alignment, Interpretierbarkeit, Missbrauchsresistenz, Cyber-Resilienz und gesellschaftliche Risikobetrachtungen. Es ist kein einzelnes Verfahren, sondern ein Bündel aus Forschungsprogrammen, Engineering-Praktiken und Governance-Strukturen.
Konzept
AI Safety strukturiert Risiken üblicherweise entlang von vier Kategorien, die sich zwar überlappen, aber unterschiedliche Massnahmen verlangen:
- Misalignment: Das System optimiert für ein Proxy-Ziel, das vom eigentlichen menschlichen Ziel abweicht. Beispiel: ein RLHF-trainiertes Modell, das Zustimmung statt Wahrheit maximiert.
- Misuse: Akteure nutzen das System gezielt für Schaden, etwa Phishing-Generierung, Desinformation oder Synthese gefährlicher Substanzen.
- Accidents: Unbeabsichtigte Fehler im Betrieb, etwa durch Distribution Shift, Eingabefehler oder Tool-Use-Versagen.
- Structural Risks: Systemische gesellschaftliche Folgen, etwa Machtkonzentration, Arbeitsmarktverwerfungen oder geopolitische Destabilisierung.
Operationalisiert wird AI Safety meist über Responsible Scaling Policies (RSPs), die Capability-Schwellen definieren und Trainings- bzw. Deploy-Entscheidungen an erreichte Sicherheitsstufen koppeln. Anthropic veröffentlichte 2023 die erste RSP, OpenAI folgte mit dem Preparedness Framework, Google DeepMind mit dem Frontier Safety Framework.
Praxis
In der industriellen Praxis besteht AI Safety aus mehreren ineinandergreifenden Schichten:
- Pre-Training Safety: Datenkuration, Filterung schädlicher Inhalte, Vermeidung problematischer Memorisation.
- Post-Training Safety: RLHF, Constitutional AI, Refusal-Training, Verfeinerung von Verhaltensrichtlinien.
- Evaluation und Red-Teaming: systematische Suche nach Failure Modes durch interne und externe Teams.
- Deployment Safety: Rate-Limits, Monitoring, Abuse-Detection, Tiered Access für gefährliche Capabilities.
- Governance: Veröffentlichung von Model Cards, System Cards, Transparency Reports.
Externe Evaluatoren wie METR, Apollo Research und das UK AI Safety Institute prüfen Frontier-Modelle vor Release. Behörden koordinieren sich über das AI Safety Institute Network (USA, UK, EU, Japan, Singapur, Kanada und weitere).
Häufige Fehler
- Safety als Marketing-Label: Ohne nachprüfbare Evaluierungen und externe Audits sind Safety-Claims wertlos.
- Benchmarks ohne Mechanismen: Modelle können Benchmark-Sicherheit zeigen, ohne sicher zu sein. Mechanistic Interpretability ist deshalb komplementär.
- Capability ohne Mitigation: Wer Capabilities veröffentlicht, ohne entsprechende Mitigationen und Monitoring zu liefern, untergräbt die eigene Safety-Strategie.
- Statische Policies: Risiken ändern sich mit jeder Modellgeneration. Policies müssen versioniert und überprüfbar sein.
- Reine Defense-Perspektive: AI Safety umfasst auch positive Use-Cases (Defensive Cyber, Wissenschaftsbeschleunigung), nicht nur Risikoabwehr.
Abgrenzung
- AI Alignment: fokussiert auf die Frage, wie Modelle menschliche Werte und Ziele abbilden. AI Safety ist breiter.
- AI Ethics: befasst sich mit normativen Fragen (Fairness, Verantwortung, Würde). AI Safety ist primär technisch und systemisch.
- AI Governance: befasst sich mit Regulierung, Standards und Institutionen. AI Safety liefert die technische Grundlage, Governance die institutionelle Verankerung.
- Trustworthy AI: EU-geprägter Oberbegriff, der AI Safety, Ethics und Governance bündelt.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist KI-Sicherheit?+
KI-Sicherheit (AI Safety) ist das interdisziplinäre Feld, das sich mit der Entwicklung und dem Betrieb von KI-Systemen befasst, die ihre intendierten Ziele zuverlässig und ohne schädliche Nebenwirkungen erreichen. Es umfasst technische Robustheit, Alignment, Interpretierbarkeit, Missbrauchsresistenz und gesellschaftliche Risikobetrachtungen.
Wie unterscheidet sich AI Safety von AI Alignment?+
AI Alignment ist ein Teilbereich von AI Safety und beschäftigt sich speziell mit der Frage, wie ein KI-System die Ziele und Werte der Menschen treffend abbildet. AI Safety ist breiter und umfasst zusätzlich Robustheit gegenüber Eingaben, Cybersicherheit, Missbrauchsprävention und systemische Risiken.
Welche Risikokategorien adressiert AI Safety?+
Typisch sind vier Kategorien: Misalignment (das System optimiert das falsche Ziel), Misuse (gezielter Missbrauch durch Akteure), Accidents (Fehler im Betrieb) und Structural Risks (gesellschaftliche oder geopolitische Folgen). Frameworks wie Anthropics Responsible Scaling Policy ordnen Massnahmen entlang dieser Kategorien.
Was ist eine Responsible Scaling Policy?+
Eine Responsible Scaling Policy (RSP) ist eine selbstverpflichtende Sicherheitsstrategie, die Trainings- und Deploy-Entscheidungen an Capability-Schwellen koppelt. Anthropic veröffentlichte 2023 die erste RSP, in der Modelle erst dann freigegeben werden, wenn Evaluierungen, Red-Teaming und Mitigationsmassnahmen die definierten Sicherheitsstufen erreichen.
Welche Rolle spielt Interpretierbarkeit für AI Safety?+
Interpretierbarkeit (Mechanistic Interpretability) versucht, das interne Verhalten neuronaler Netze nachvollziehbar zu machen. Sie ist Voraussetzung dafür, dass Sicherheitsclaims überprüfbar sind: ein als sicher beworbenes Modell muss in seinem Innenleben auch sicher entscheiden, nicht nur in ausgewählten Benchmarks.
Welche Standards existieren bereits?+
Das NIST AI Risk Management Framework (USA), der EU AI Act, ISO/IEC 42001 für KI-Management-Systeme sowie unternehmensspezifische Frameworks wie OpenAIs Preparedness Framework und Anthropics RSP. International koordinieren sich Behörden über das AI Safety Institute Network.
Wie wird AI Safety in der Praxis getestet?+
Üblich sind Red-Teaming (gezielte Angriffsversuche), Capability Evaluations (Tests gefährlicher Fähigkeiten wie Bioweapons-Wissen oder autonome Aktionen), Bias-Audits, Stress-Tests, Out-of-Distribution-Tests sowie laufende Monitoring-Systeme im Produktivbetrieb. Externe Evaluatoren wie METR oder Apollo Research ergänzen interne Tests.
Warum ist AI Safety auch ein Geschäftsmodell?+
Sicherheitsclaims sind für Enterprise-Kunden, Regulatoren und Versicherer entscheidungsrelevant. Anbieter, die nachweisbare Safety-Praktiken vorlegen, gewinnen Zugang zu regulierten Branchen (Gesundheit, Finanz, Defense) und reduzieren Haftungsrisiken. Safety wird zunehmend zum Differenzierungsmerkmal.
Verwandte Begriffe
Quellen
- Anthropic Responsible Scaling Policy
- OpenAI Preparedness Framework
- NIST AI Risk Management Framework
Wikidata: Q116291231 · Zuletzt geprüft: 2026-06-07