Agentic Relations

Constitutional AI

Von Anthropic entwickeltes Trainingsverfahren, das ein Sprachmodell anhand einer expliziten Liste von Prinzipien (Constitution) zur Selbstkritik und Selbstkorrektur anleitet und damit RLHF teilweise ersetzt.

Definition

Constitutional AI (CAI) ist ein von Anthropic 2022 entwickeltes Trainingsverfahren, bei dem ein Sprachmodell anhand einer expliziten Liste von Prinzipien (Constitution) zur Selbstkritik und Selbstkorrektur angeleitet wird. Es reduziert die Abhängigkeit von teuren menschlichen Präferenzlabels, macht die zugrundeliegenden Werte transparent und ist Teil von Anthropics Antwort auf das Skalierungsproblem klassischer RLHF.

Der Begriff stammt aus dem gleichnamigen Paper (Bai et al., 2022) und ist heute ein zentraler Baustein der Claude-Modelle. Die Idee: statt menschliche Labeler bei jeder Antwort über Hilfsbereitschaft und Harmlosigkeit entscheiden zu lassen, formuliert man die Werte einmal als Constitution und nutzt sie als Anker für die Selbstkorrektur des Modells.

Konzept

Die CAI-Pipeline besteht aus zwei Hauptphasen:

  • Supervised Learning Phase (SL-CAI): Das Modell generiert Antworten auf adversarielle Prompts, kritisiert sie anhand der Constitution und revidiert sie. Diese Revisionen bilden den Trainingsdatensatz für Supervised Fine-Tuning.
  • Reinforcement Learning Phase (RL-CAI): Ein KI-Reward-Modell wird auf Präferenzpaaren trainiert, die durch das Modell selbst (mit Constitution als Bewertungsgrundlage) erzeugt werden. Anschliessend wird das Sprachmodell per RL gegen dieses Reward-Modell optimiert. Dieser Schritt ist eine Form von RLAIF (Reinforcement Learning from AI Feedback).

Die Constitution selbst kombiniert verschiedene Quellen: die UN-Menschenrechtserklärung, Apple Terms of Service, DeepMind Sparrow Rules und eigene Anthropic-Prinzipien. Inhaltlich adressiert sie Vermeidung von Schaden, Ehrlichkeit, Privacy, Nichtdiskriminierung und Hilfsbereitschaft.

Praxis

Anthropic setzt CAI als zentrale Trainingskomponente aller Claude-Modelle ein, meist kombiniert mit klassischem RLHF und gezieltem Red-Teaming. Die Constitution wird zwischen Modellgenerationen weiterentwickelt und teilweise publiziert.

2023 erweiterte Anthropic das Verfahren mit Collective Constitutional AI: ca. 1000 US-Bürger deliberierten über Prinzipien und stellten eine alternative Constitution auf. Das Experiment adressierte die normative Frage Wer entscheidet über die Werte? und untersuchte, ob partizipative Constitutions zu vergleichbar guter oder besserer Performance führen.

Andere Anwendungsbereiche:

  • Open-Source-Communities: adaptieren CAI für Domänen-Modelle, z.B. medizinische oder juristische Constitutions.
  • Enterprise-Customization: Kunden definieren eigene Constitutions für interne Assistenten.
  • Akademische Forschung: CAI-Konzepte fliessen in Scalable-Oversight- und Debate-Verfahren ein.

Häufige Fehler

  • Constitution als objektives Dokument missverstehen: Die Constitution ist eine normative Wahl, keine neutrale Spezifikation. Wer sie schreibt, prägt das Verhalten.
  • Skalierung mit Verlässlichkeit verwechseln: CAI reduziert menschliche Labels, ersetzt aber nicht die Notwendigkeit menschlicher Aufsicht. Das KI-Reward-Modell kann systematische Fehler erben.
  • Constitution ohne Eval-Suite: Ohne klare Tests gegen die Constitution lässt sich nicht überprüfen, ob das Modell die Prinzipien tatsächlich befolgt.
  • Statische Constitution: Werte und Risiken verändern sich. Die Constitution muss versioniert, dokumentiert und periodisch überarbeitet werden.
  • CAI als Marketing-Label: Ohne nachprüfbare Implementierung ist die blosse Existenz einer Constitution kein Sicherheitsbeweis.

Abgrenzung

  • RLHF: klassisches Verfahren mit menschlichen Präferenzen. CAI ergänzt oder ersetzt Teile davon, beide werden meist kombiniert eingesetzt.
  • RLAIF: Oberbegriff für RL mit KI-generierten Präferenzen. CAI ist eine spezifische Variante mit expliziter Constitution.
  • System-Prompts: steuern Modellverhalten zur Antwortzeit. CAI verankert Werte im Modellgewicht.
  • Refusal-Training: lehrt das Modell, bestimmte Anfragen abzulehnen. CAI ist breiter und prägt das gesamte Antwortverhalten.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist Constitutional AI?+

Constitutional AI (CAI) ist ein von Anthropic entwickeltes Trainingsverfahren, bei dem ein Sprachmodell anhand einer expliziten Liste von Prinzipien (Constitution) zur Selbstkritik und Selbstkorrektur angeleitet wird. Es reduziert die Abhängigkeit von menschlichen Präferenzlabels und macht die zugrundeliegenden Werte transparent.

Wie funktioniert CAI im Vergleich zu RLHF?+

RLHF nutzt menschliche Präferenzpaare zum Reward-Modell-Training. CAI nutzt stattdessen das Modell selbst, das anhand der Constitution Antworten kritisiert und überarbeitet. Aus diesen Selbstrevisionen werden Trainingsdaten gewonnen, anschliessend folgt ein RL-Schritt gegen ein KI-Reward-Modell (RLAIF).

Welche Prinzipien stehen typischerweise in der Constitution?+

Anthropics Constitution kombiniert Quellen wie die UN-Menschenrechtserklärung, Apple Terms of Service, DeepMind Sparrow Rules und eigene Forschungsprinzipien. Inhaltlich geht es um Vermeidung von Schaden, Ehrlichkeit, Schutz von Privacy, Nichtdiskriminierung und Hilfsbereitschaft.

Was sind die Hauptvorteile?+

Transparenz (die Werte sind explizit dokumentiert), Skalierbarkeit (weniger menschliche Labels nötig), bessere Performance bei schwer bewertbaren Outputs (Scalable Oversight) und konsistentere Verhaltensführung. CAI ist Teil von Anthropics Antwort auf das Skalierungsproblem von RLHF.

Welche Schwächen hat CAI?+

Die Constitution selbst ist eine Wertentscheidung, die normativ begründet werden muss. Schlechte Prinzipien führen zu schlechtem Verhalten. Zudem ist CAI weniger erforscht als RLHF, und das Verfahren erbt einen Teil der RLAIF-Limitationen, da das KI-Reward-Modell selbst fehlerbehaftet sein kann.

Was ist Collective Constitutional AI?+

Collective Constitutional AI (Anthropic 2023) ist ein Experiment, bei dem die Constitution durch demokratische Deliberation mit ca. 1000 US-Bürgern entwickelt wurde. Ziel war, die Frage Wer entscheidet über die Werte? zu adressieren und partizipative Alternativen zu erforschen.

Wer setzt CAI praktisch ein?+

Anthropic setzt CAI bei allen Claude-Modellen ein, in Kombination mit RLHF und gezieltem Red-Teaming. Open-Source-Communities adaptieren das Verfahren zunehmend (z.B. mit eigenen Constitutions für Domänen-spezifische Modelle). Auch akademische Forschung greift CAI-Konzepte auf.

Ist CAI ein Ersatz für RLHF?+

Nein, eher eine Ergänzung. Anthropic kombiniert CAI mit klassischem RLHF. CAI liefert prinzipiengetriebene Selbstkorrektur, RLHF liefert nutzerorientierte Feinjustierung. Beide adressieren verschiedene Aspekte des Alignment-Problems.

Verwandte Begriffe

Quellen

  • Anthropic Constitutional AI Paper (2022)
  • Anthropic Claude Constitution
  • Anthropic Collective Constitutional AI Research

Zuletzt geprüft: 2026-06-07