NachschlagenQuellenregister

Originalarbeiterreichbar

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

arxiv.org (externe Seite)

Shao und Mitautoren stellen am 05.02.2024 mit DeepSeekMath das Verfahren GRPO vor, eine Variante von PPO, die je Aufgabe eine Gruppe von Antworten zieht und sie gegeneinander wertet, ohne ein eigenes Wertmodell zu trainieren. Dasselbe Verfahren steht hinter DeepSeek R1 und hinter dem GRPO-Trainer von TRL.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 15.09.2026:

  • we introduce Group Relative Policy Optimization (GRPO), a variant of Proximal Policy Optimization (PPO), that enhances mathematical reasoning abilities while concurrently optimizing the memory usage of PPObestätigt 24.09.2026

TRL schickt beim asynchronen Training nur noch den LoRA-Adapter an vLLM, Trainer und Inferenz brauchen keine gemeinsame Maschine mehrGroup Relative Policy Optimization im Glossar

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.