NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

Scaling Laws for Neural Language Models

arxiv.org (externe Seite)

Kaplan und Mitautoren bei OpenAI messen am 23.01.2020, wie der Fehler eines Sprachmodells mit Modellgröße, Datenmenge und Rechenaufwand fällt. Das Ergebnis ist ein Potenzgesetz, einzelne der Verläufe über mehr als sieben Größenordnungen, und damit lässt sich der Ertrag eines größeren Trainingslaufs vorher abschätzen. Vier Monate vor GPT-3. Die eigene Empfehlung der Arbeit, sehr große Modelle auf vergleichsweise wenig Daten zu trainieren, hat DeepMind 2022 mit Chinchilla korrigiert, siehe chinchilla-2022.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:

  • The loss scales as a power-law with model size, dataset size, and the amount of compute used for training, with some trends spanning more than seven orders of magnitude.bestätigt 24.09.2026
  • optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergencebestätigt 24.09.2026

KI-Geschichte05 Geschwindigkeit der Entwicklung

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.