Artikelerreichbar
LoRA Without Regret
thinkingmachines.ai (externe Seite)
Schulman und Mitautoren bei Thinking Machines messen im September 2025, wann ein LoRA-Adapter dem vollen Fine-Tuning gleichkommt. Für Reinforcement Learning mit Policy-Gradient-Verfahren gilt das nach ihrer Messung schon bei Rang 1, begründet damit, dass die Bewertung je Episode nur wenige Bit Information liefert. Der Text stammt von einem Anbieter, der Fine-Tuning als Dienst verkauft.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 15.09.2026:
LoRA fully matches the learning performance of FullFT when running policy gradient algorithms for reinforcement learning, even with ranks as low as 1
bestätigt 24.09.2026in policy gradient methods, learning is driven by the advantage function which provides only O(1) bits per episode
bestätigt 24.09.2026
TRL schickt beim asynchronen Training nur noch den LoRA-Adapter an vLLM, Trainer und Inferenz brauchen keine gemeinsame Maschine mehrLow-Rank Adaptation im Glossar