Originalarbeiterreichbar
Constitutional AI: Harmlessness from AI Feedback
Die Arbeit von 2022, in der menschliche Bewertungen zur Harmlosigkeit durch eine aufgeschriebene Regelliste ersetzt werden. Das Modell kritisiert und überarbeitet seine eigenen Antworten anhand dieser Liste. Für ein Kapitel über das Innenleben zählt daran, dass die Ausrichtung eines Modells damit ein Forschungsprogramm mit veröffentlichten Verfahren ist. Eine Einstellung, die jemand umlegt, ist sie nicht.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
We experiment with methods for training a harmless AI assistant through self-improvement, without any human labels identifying harmful outputs.
bestätigt 24.09.2026The only human oversight is provided through a list of rules or principles
bestätigt 24.09.2026