Originalarbeiterreichbar
Better & Faster Large Language Models via Multi-token Prediction
Gloeckle und Mitautoren von Meta AI schlagen am 30.04.2024 vor, ein Sprachmodell über mehrere unabhängige Ausgabeköpfe auf einem gemeinsamen Rumpf mehrere zukünftige Token statt nur des nächsten vorhersagen zu lassen. Der Ursprung des Verfahrens, das DeepSeek-V3 später für das Speculative Decoding wiederverwendet.
geprüft 24.09.2026Archivfassung (externe Seite, web.archive.org)
Worauf sich diese Seite beruft, wörtlich, abgerufen am 08.08.2026:
we ask the model to predict the following n tokens using n independent output heads, operating on top of a shared model trunk
bestätigt 24.09.2026
Elf Wege, ein lokales Modell schneller zu machenMulti-Token Prediction im Glossar