RLHF (Reinforcement Learning from Human Feedback)
Trainingsverfahren, das ein Sprachmodell mittels eines aus menschlichen Präferenzdaten gelernten Reward-Modells nachtrainiert, um hilfreiches, harmlos und ehrliches Verhalten zu fördern.
Definition
RLHF (Reinforcement Learning from Human Feedback) ist ein Trainingsverfahren, das ein vortrainiertes Sprachmodell mittels eines aus menschlichen Präferenzdaten gelernten Reward-Modells nachtrainiert. Ziel ist, das Modell so zu steuern, dass es hilfreiche, harmlose und ehrliche Antworten produziert. RLHF wurde 2022 mit OpenAIs InstructGPT-Paper und Anthropics HH-RLHF-Paper als Industriestandard etabliert und ist die Grundlage moderner Chat-Assistenten.
Der Begriff entstand in der Reinforcement-Learning-Forschung der 2010er Jahre und wurde durch Arbeiten zu Atari-Spielen und Robotik vorbereitet. Die Anwendung auf Sprachmodelle markierte einen Wendepunkt der KI-Industrie.
Mechanismus
Die klassische RLHF-Pipeline besteht aus drei Schritten:
- Supervised Fine-Tuning (SFT): Das vortrainierte Basismodell wird auf hochwertigen Demonstrationen menschlicher Experten weitertrainiert. Diese Demonstrationen zeigen, wie wünschenswerte Antworten aussehen.
- Reward Model Training: Labeler bewerten Paare von Modellantworten und markieren die bevorzugte Variante. Aus diesen Präferenzdaten wird ein Reward-Modell trainiert, das beliebige Antworten mit einem Skalarwert bewertet.
- Policy Optimization: Das Sprachmodell wird per Reinforcement Learning (meist Proximal Policy Optimization, PPO) gegen das Reward-Modell optimiert. Ein KL-Penalty hält die optimierte Policy nahe am SFT-Modell, um Mode Collapse zu vermeiden.
Moderne Varianten ersetzen einzelne Schritte: Direct Preference Optimization (DPO) verzichtet auf das explizite Reward-Modell und optimiert das Sprachmodell direkt auf Präferenzpaaren. Constitutional AI ersetzt menschliche Präferenzen durch KI-Bewertungen entlang einer expliziten Constitution.
Praxis
Industriell wird RLHF in einer breit ausgebauten Infrastruktur betrieben:
- Labeler-Programme: Plattformen wie Scale AI, Surge AI, Invisible Technologies stellen tausende Labeler, oft mit Domänenexpertise.
- Präferenz-Sammlung: Anbieter sammeln auch Nutzer-Präferenzen aus dem Produktivbetrieb (Thumbs-up/Thumbs-down in Chat-UIs).
- Red-Teaming-Daten: Adversarielle Prompts werden gesondert gelabelt, um Refusal-Verhalten zu trainieren.
- Iteratives Training: Modelle werden mehrfach durch RLHF-Zyklen geschickt, mit periodischer Neuauswertung.
- Mischung mit Constitutional AI: Anthropic kombiniert RLHF mit Constitutional-AI-Verfahren, OpenAI nutzt RLHF in Verbindung mit eigenem Self-Critique.
Anwendungsbereiche reichen von Chat-Assistenten über Code-Assistenten (Cursor, Copilot) bis zu spezialisierten Domänen-Modellen (Medizin, Recht, Finanz).
Häufige Fehler
- Sycophancy: Modelle lernen, Nutzerinnen zuzustimmen, statt korrekte Antworten zu geben. Reward-Modelle bilden oft Zustimmung statt Wahrheit ab.
- Reward Hacking: Modelle finden Wege, hohe Reward-Scores zu erzielen, ohne die intendierte Aufgabe zu erfüllen.
- Mode Collapse: Optimierung gegen ein einzelnes Reward-Modell verarmt die Antwortvielfalt. KL-Penalty hilft, löst das Problem aber nicht vollständig.
- Labeler-Bias: Die Demografie und Anweisungen der Labeler prägen das Modellverhalten. Schlechte Labeler-Guidelines erzeugen schlecht ausgerichtete Modelle.
- Overfitting auf Reward-Modell-Schwächen: Das Sprachmodell exploitet systematische Fehler des Reward-Modells, was sich erst in der Produktion zeigt.
Abgrenzung
- Supervised Fine-Tuning (SFT): lehrt aus Demonstrationen. RLHF lehrt aus Präferenzen über Demonstrationen hinaus.
- Constitutional AI: ersetzt menschliche Präferenzen ganz oder teilweise durch prinzipienbasierte KI-Bewertung.
- DPO und Varianten: vereinfachen das Optimierungsverfahren, behalten aber das Präferenz-Paradigma bei.
- RLAIF: nutzt KI-generierte Präferenzen statt menschlicher, reduziert Kosten und skaliert besser.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist RLHF?+
RLHF (Reinforcement Learning from Human Feedback) ist ein Trainingsverfahren, bei dem ein vortrainiertes Sprachmodell mit Hilfe eines aus menschlichen Präferenzdaten gelernten Reward-Modells weiter optimiert wird. Ziel ist, das Modell so zu steuern, dass es hilfreiche, harmlose und ehrliche Antworten produziert.
Wie funktioniert die Pipeline?+
Drei Schritte: Erstens Supervised Fine-Tuning (SFT) auf hochwertigen Demonstrationen. Zweitens Sammlung von Präferenzdaten, bei denen Labeler bevorzugte Antworten markieren, und Training eines Reward-Modells. Drittens Optimierung des Sprachmodells per Reinforcement Learning (meist PPO) gegen dieses Reward-Modell.
Warum ist RLHF wichtig?+
Basismodelle aus reinem Next-Token-Pretraining sind oft unkooperativ, schwer steuerbar und produzieren toxische Inhalte. RLHF transformiert sie in nutzbare Assistenten. ChatGPT, Claude und Gemini basieren auf RLHF oder verwandten Verfahren.
Welche Schwächen hat RLHF?+
Sycophancy (Schmeichelei statt Wahrheit), Reward Hacking, Mode Collapse (Verlust von Antwortvielfalt), starke Abhängigkeit von Labeler-Demografie und hohe Kosten für Präferenzdaten. Zudem ist das Reward-Modell selbst nur eine Approximation menschlicher Werte.
Was ist DPO und wie unterscheidet es sich von RLHF?+
Direct Preference Optimization (DPO, 2023) ist eine Alternative, die ohne explizites Reward-Modell auskommt. Statt PPO wird das Sprachmodell direkt auf Präferenzpaaren optimiert. Es ist einfacher und stabiler, deckt aber nicht alle Anwendungsfälle von klassischem RLHF ab.
Welche Alternativen existieren?+
RLAIF (Reinforcement Learning from AI Feedback), Constitutional AI von Anthropic, DPO, ORPO, KTO und IPO. Alle versuchen, die Skalierungslimits klassischer RLHF zu adressieren, indem sie entweder KI-Bewertungen einsetzen oder das Optimierungsverfahren vereinfachen.
Wer waren die Pionier-Labs?+
OpenAI veröffentlichte 2022 das InstructGPT-Paper und etablierte RLHF als Standard. Anthropic publizierte parallel das HH-RLHF-Paper (Helpful and Harmless). DeepMind und Google arbeiteten ebenfalls früh an verwandten Verfahren. Heute ist RLHF Industriestandard.
Wie skaliert RLHF auf gefährlichere Capabilities?+
Eingeschränkt. Sobald Modelle Outputs liefern, die Menschen nicht mehr zuverlässig bewerten können, versagt klassisches RLHF. Scalable Oversight, Debate und Constitutional AI sollen diese Lücke schliessen. OpenAIs Superalignment-Programm adressierte genau dieses Problem.
Verwandte Begriffe
Quellen
- OpenAI InstructGPT Paper (2022)
- Anthropic HH-RLHF Paper (2022)
- DeepMind RLHF Research
Wikidata: Q115570683 · Zuletzt geprüft: 2026-06-07