NachschlagenQuellenregister

Originalarbeiterreichbar

Constitutional AI: Harmlessness from AI Feedback

arxiv.org (externe Seite)

Die Arbeit von 2022, in der menschliche Bewertungen zur Harmlosigkeit durch eine aufgeschriebene Regelliste ersetzt werden. Das Modell kritisiert und überarbeitet seine eigenen Antworten anhand dieser Liste. Für ein Kapitel über das Innenleben zählt daran, dass die Ausrichtung eines Modells damit ein Forschungsprogramm mit veröffentlichten Verfahren ist. Eine Einstellung, die jemand umlegt, ist sie nicht.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:

  • We experiment with methods for training a harmless AI assistant through self-improvement, without any human labels identifying harmful outputs.bestätigt 24.09.2026
  • The only human oversight is provided through a list of rules or principlesbestätigt 24.09.2026

Alignment im Glossar06 Der Blick ins Modell

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.