Originalarbeiterreichbar
Compact Language Models via Pruning and Knowledge Distillation
Muralidharan und Mitautoren bei NVIDIA beziffern am 19.07.2024 den Abstand zwischen den beiden Bauwegen. Ein 8- und ein 4-Milliarden-Modell aus einem vorhandenen 15-Milliarden-Modell abzuleiten kostet bis zu vierzigmal weniger Trainingstoken, als beide von Grund auf zu trainieren. Das ist der Grund, warum Modellfamilien überwiegend so entstehen, und zugleich die Zahl, gegen die ein zugeschnittenes Modell antreten muss.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:
Deriving 8B and 4B models from an already pretrained 15B model using our approach requires up to 40x fewer training tokens per model compared to training from scratch
bestätigt 24.09.2026