Warum KI-Modelle besser werden — ohne dass jemand neuen Code schreibt
ChatGPT im Jahr 2022 und ChatGPT im Jahr 2025: dieselbe Grundarchitektur, ein völlig anderes Qualitätsniveau. Das Modell wurde nicht neu erfunden. Was sich verändert hat, ist das Training — genauer gesagt: das Feedback-Training.
Dieser Artikel erklärt, wie RLHF, Constitutional AI und verwandte Methoden funktionieren, welche Ziele sie gleichzeitig optimieren — und was das für Unternehmen bedeutet, die KI einsetzen oder eigene Modelle fine-tunen wollen.
RLHF: Reinforcement Learning from Human Feedback
Die grundlegende Idee ist einfach. Das Modell lernt nicht mehr nur aus Texten, sondern aus menschlichem Urteil darüber, was eine gute Antwort ist. Das Verfahren läuft in fünf Schritten ab:
- Das Modell generiert auf dieselbe Frage zwei unterschiedliche Antworten.
- Ein menschlicher Bewerter entscheidet: welche Antwort ist besser?
- Aus Tausenden solcher Vergleiche lernt das System, was Menschen unter „besser" verstehen.
- Ein separates Reward-Modell internalisiert diese Präferenzen als numerische Bewertungsfunktion.
- Das Hauptmodell wird so trainiert, dass es die Bewertung durch das Reward-Modell maximiert.
Das Ergebnis: das Modell verbessert sich nicht durch neue Architektur oder mehr Parameter, sondern durch präziseres Feedback auf bestehende Fähigkeiten.
Das HHH-Dreieck: drei Ziele, eine Spannung
Anthropic hat diesen Ansatz mit einem konkreten Zielrahmen verbunden: dem HHH-Framework. Die drei Buchstaben stehen für die drei Eigenschaften, die ein gutes Sprachmodell gleichzeitig erfüllen soll.
Das Modell beantwortet Fragen direkt und vollständig — ohne unnötige Ausweichmanöver oder künstliche Einschränkungen.
Das Modell verweigert schädliche Anfragen — ohne dabei legitime Anfragen voreilig abzulehnen.
Das Modell gibt Unsicherheiten zu und erfindet keine Fakten — auch wenn der Nutzer eine falsche Annahme zu bestätigen scheint.
Diese drei Ziele stehen in echter Spannung zueinander: Ein maximal hilfreiches Modell neigt dazu, Fakten zu erfinden, weil das die unmittelbare Nutzerzufriedenheit erhöht. Ein maximal harmloses Modell lehnt zu viel ab. RLHF kalibriert diese Balance — nicht durch Regeln im Code, sondern durch Feedback auf echte Modellantworten.
Das Problem mit menschlichem Feedback: Kosten und Skalierung
RLHF hat einen offensichtlichen Engpass: Menschliches Feedback ist teuer. Für spezialisierte Bereiche — Medizin, Recht, Steuern — braucht man qualifizierte Bewerter, nicht nur gut ausgebildete Allrounder. Tausende Vergleiche für jede Domäne sind kaum skalierbar.
Die Antwort darauf heißt RLAIF: Reinforcement Learning from AI Feedback. Ein stärkeres Modell bewertet die Outputs eines schwächeren. In bestimmten Bereichen liefert das vergleichbare Ergebnisse wie menschliches RLHF — bei einem Bruchteil der Kosten.
Grenze von RLAIF: Der Schüler kann den Lehrer nicht übertreffen. Ein schwächeres Modell, das von einem stärkeren bewertet wird, kann maximal so gut werden wie das bewertende Modell — nicht besser. Für echten Fortschritt an der Qualitätsgrenze bleibt menschliches Feedback unverzichtbar.
Constitutional AI: Werte statt externer Belohnung
Anthropic hat 2022 eine Methode veröffentlicht, die das RLHF-Prinzip einen Schritt weiterdenkt: Constitutional AI. Statt einem Reward-Modell, das Präferenzen aus Vergleichen lernt, bekommt das Modell eine Verfassung — eine Sammlung von Prinzipien, gegen die es seine eigenen Antworten prüft.
Ein Beispielprinzip aus der Anthropic-Verfassung:
„Wähle die Antwort, die weniger wahrscheinlich schädlichen, illegalen, manipulativen oder täuschenden Inhalt enthält."
Das Trainingsprozedere funktioniert so:
- Das Modell generiert eine Antwort auf eine Anfrage.
- Es bewertet diese Antwort selbst gegen die Verfassungsprinzipien.
- Es schreibt die Antwort um, wenn sie ein Prinzip verletzt.
- Originale und überarbeitete Antwort bilden ein Trainings-Datenpaar.
Der entscheidende Unterschied zum klassischen RLHF: Das Modell internalisiert Werte, statt nur externe Belohnungssignale zu maximieren. Es entwickelt eine Art Selbstkritik — was zu robusterem Verhalten führt als ein reines Optimieren gegen ein Reward-Modell.
Was das für die Praxis bedeutet
Drei Konsequenzen, die für Unternehmen und Entwickler direkt relevant sind:
Modelle verbessern sich ohne neue Versionen. Kontinuierliches Feedback fließt in die nächste Trainingsrunde ein. Was heute als schlechte Antwort markiert wird, taucht morgen seltener auf — ohne dass eine neue Modellversion veröffentlicht wird.
Fine-Tuning nach demselben Prinzip. Dasselbe Verfahren funktioniert im Kleinen: Ein Unternehmen, das eigene Beispiele bereitstellt, lehrt das Modell, was in seinem spezifischen Kontext „gut" bedeutet. Die Qualitätsdefinition liegt im Feedback, nicht im Code.
Kontrolle über Modellverhalten liegt im Feedback. Wer bestimmt, welche Antworten als „besser" bewertet werden, bestimmt die Werte des Modells. Das ist eine strategische Entscheidung — nicht nur eine technische.
Warum Modelle trotzdem halluzinieren
RLHF kann nur optimieren, was sich messen lässt. Kurzfristig erkennbare Qualität — Stil, Ton, Vollständigkeit — lässt sich gut über Feedback verbessern. Langfristige Konsequenzen, Spezialistenwissen und subtile Manipulation sind schwer kurzfristig zu bewerten.
Halluzinationen sind besonders hartnäckig: Eine erfundene Quellenangabe klingt plausibel. Wer in der Bewertungsrunde keine Zeit hat, sie nachzuschlagen, markiert die Antwort als gut. Das Reward-Modell lernt: überzeugend klingende Antworten sind bevorzugt — unabhängig davon, ob sie wahr sind.
Das ist kein Versagen von RLHF, sondern eine Grenze des Ansatzes: Er verbessert, was beobachtbar und bewertbar ist. Was sich dem Feedback entzieht, bleibt ein Problem.
Produktiv damit arbeiten
Wer diese Mechanismen versteht, kann KI besser einsetzen:
- Klare Qualitätskriterien im Prompt. Je präziser die Anforderungen, desto besser kann das Modell sein eigenes Output bewerten — und desto näher liegt das Ergebnis an dem, was RLHF optimiert hat.
- Verifiable Outputs bevorzugen. Aufgaben, deren Ergebnis prüfbar ist (Codeausführung, Datenbankabfragen, Berechnungen), profitieren weniger von Halluzinationstendenzen.
- Feedback-Schleifen einbauen. Wer schlechte Outputs systematisch markiert — ob in einem Fine-Tuning-Setup oder als Signal an den Provider — trägt dazu bei, dass das Modell in seiner Domäne besser wird.
RLHF und Constitutional AI sind keine Marketing-Begriffe. Sie sind die Mechanismen, die erklären, warum ein Modell mit derselben Architektur heute anders antwortet als vor drei Jahren — und warum Qualitätskontrolle beim KI-Einsatz im Kern eine Frage von Feedback-Design ist.
KI produktiv einsetzen — vom Prompt bis zum autonomen Agenten
Im Kurs Claude Code Mastery lernen Sie, wie Sie KI-Modelle nicht nur nutzen, sondern steuern: Prompting-Strategien, Fine-Tuning-Grundlagen, Agenten-Workflows und Qualitätskontrolle in der Praxis.
Für Berater, Entwickler und Teams, die mehr aus KI herausholen wollen als das, was die Standardantwort liefert.
Zum Kurs →