Dokumentationerreichbar
TRL, Transformer Reinforcement Learning
huggingface.co (externe Seite)
Die Einstiegsseite der Bibliothek von Hugging Face für das Nachtraining von Sprachmodellen. Sie nennt die Verfahren (SFT, GRPO, DPO, Reward Modeling) und führt den asynchronen GRPO-Trainer als experimentellen Teil.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 15.09.2026:
TRL is a full stack library where we provide a set of tools to train transformer language models with methods like Supervised Fine-Tuning (SFT), Group Relative Policy Optimization (GRPO), Direct Preference Optimization (DPO), Reward Modeling, and more
bestätigt 24.09.2026