NachschlagenQuellenregister

Originalarbeiterreichbar

SozKZ: Training Efficient Small Language Models for Kazakh from Scratch

arxiv.org (externe Seite)

Tukenov trainiert am 21.03.2026 eine Modellfamilie von 50 bis 600 Millionen Parametern von Grund auf für das Kasachische, mit einem eigenen Vokabular aus 50.000 Einträgen. Die Begründung nennt die Arbeit im ersten Satz: Mehrsprachige Modelle geben einer solchen Sprache wenig Kapazität, und ihre Zerlegung passt schlecht zu deren Bau. Das 600-Millionen-Modell erreicht bei kasachischen Aufgaben, was doppelt so große mehrsprachige Modelle erreichen, gemessen an drei Prüfsammlungen gegen fünf Vergleichsmodelle.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:

  • which allocate minimal capacity to low-resource languages and employ tokenizers ill-suited to agglutinative morphologybestätigt 24.09.2026
  • trained entirely from scratch on 9 billion tokens of Kazakh text with a dedicated 50K BPE tokenizerbestätigt 24.09.2026
  • small, dedicated models trained from scratch with a language-appropriate tokenizer offer a viable path for low-resource language technologybestätigt 24.09.2026

10 Small Language Models

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.