NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

Training language models to follow instructions with human feedback

arxiv.org (externe Seite)

Ouyang und Mitautoren zeigen am 04.03.2022, dass ein deutlich kleineres, mit menschlicher Rückmeldung nachtrainiertes Modell hilfreicher antwortet als ein sehr viel größeres ohne. Das ist der Schritt, der aus einem Textfortsetzer einen Assistenten macht, und die Voraussetzung für ChatGPT acht Monate später.

geprüft 24.09.2026

KI-GeschichteFine-Tuning im GlossarReinforcement Learning im GlossarReinforcement Learning from Human Feedback im Glossar01 Was ein Sprachmodell ist02 Ein Modell auf eigene Daten abstimmen05 Der Prompt06 Gute Prompts schreiben

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.