SchlüsselarbeitOriginalarbeiterreichbar
Training language models to follow instructions with human feedback
Ouyang und Mitautoren zeigen am 04.03.2022, dass ein deutlich kleineres, mit menschlicher Rückmeldung nachtrainiertes Modell hilfreicher antwortet als ein sehr viel größeres ohne. Das ist der Schritt, der aus einem Textfortsetzer einen Assistenten macht, und die Voraussetzung für ChatGPT acht Monate später.
geprüft 24.09.2026
KI-GeschichteFine-Tuning im GlossarReinforcement Learning im GlossarReinforcement Learning from Human Feedback im Glossar01 Was ein Sprachmodell ist02 Ein Modell auf eigene Daten abstimmen05 Der Prompt06 Gute Prompts schreiben