Originalarbeiterreichbar
SozKZ: Training Efficient Small Language Models for Kazakh from Scratch
Tukenov trainiert am 21.03.2026 eine Modellfamilie von 50 bis 600 Millionen Parametern von Grund auf für das Kasachische, mit einem eigenen Vokabular aus 50.000 Einträgen. Die Begründung nennt die Arbeit im ersten Satz: Mehrsprachige Modelle geben einer solchen Sprache wenig Kapazität, und ihre Zerlegung passt schlecht zu deren Bau. Das 600-Millionen-Modell erreicht bei kasachischen Aufgaben, was doppelt so große mehrsprachige Modelle erreichen, gemessen an drei Prüfsammlungen gegen fünf Vergleichsmodelle.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:
which allocate minimal capacity to low-resource languages and employ tokenizers ill-suited to agglutinative morphology
bestätigt 24.09.2026trained entirely from scratch on 9 billion tokens of Kazakh text with a dedicated 50K BPE tokenizer
bestätigt 24.09.2026small, dedicated models trained from scratch with a language-appropriate tokenizer offer a viable path for low-resource language technology
bestätigt 24.09.2026