Originalarbeiterreichbar
In-Place Tokenizer Expansion for Pre-trained LLMs
Smith und Mitautoren zeigen am 16.07.2026, warum ein kleines Modell beim Vokabular sparen muss. Bei einem Modell in der Cloud fallen die Tabellen für Vokabular und Ausgabeschicht kaum ins Gewicht, bei einem kompakten Modell bestimmen sie einen erheblichen Teil der Bandbreite je Zeichenkette. Modelle für das Gerät fahren deshalb kleine Vokabulare und nehmen in Kauf, dass Sprachen außerhalb ihres Zuschnitts in viele Bruchstücke zerfallen. Nach einer Erweiterung messen die Autoren für Hindi und Vietnamesisch rund 2,4- und 2,6-fach weniger Zeichenketten.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:
On a compact model those matrices are a material share of per-token decode bandwidth, so on-device models ship small vocabularies and accept fragmentation outside a fixed language set.
bestätigt 24.09.2026