SchlüsselarbeitOriginalarbeiterreichbar
Scaling Laws for Neural Language Models
Kaplan und Mitautoren bei OpenAI messen am 23.01.2020, wie der Fehler eines Sprachmodells mit Modellgröße, Datenmenge und Rechenaufwand fällt. Das Ergebnis ist ein Potenzgesetz, einzelne der Verläufe über mehr als sieben Größenordnungen, und damit lässt sich der Ertrag eines größeren Trainingslaufs vorher abschätzen. Vier Monate vor GPT-3. Die eigene Empfehlung der Arbeit, sehr große Modelle auf vergleichsweise wenig Daten zu trainieren, hat DeepMind 2022 mit Chinchilla korrigiert, siehe chinchilla-2022.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
The loss scales as a power-law with model size, dataset size, and the amount of compute used for training, with some trends spanning more than seven orders of magnitude.
bestätigt 24.09.2026optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence
bestätigt 24.09.2026