NachschlagenQuellenregister

Originalarbeiterreichbar

Training Compute-Optimal Large Language Models

arxiv.org (externe Seite)

Hoffmann und Mitautoren messen am 29.03.2022 an über 400 Modellen, wie Parameterzahl und Datenmenge bei festem Rechenbudget zusammengehören, und korrigieren damit die Empfehlung von scaling-laws-2020: Bei doppelter Modellgröße gehört die doppelte Datenmenge dazu. Chinchilla mit 70 Milliarden Parametern schlägt Gopher mit 280 Milliarden. Der Beleg dafür, dass die Parameterzahl allein wenig über ein Modell sagt.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:

  • We find that current large language models are significantly undertrained, a consequence of the recent focus on scaling language models whilst keeping the amount of training data constant.bestätigt 24.09.2026
  • for every doubling of model size the number of training tokens should also be doubledbestätigt 24.09.2026

05 Geschwindigkeit der Entwicklung

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.