GrundlagenKI-WissenKapitel 10von 14 im Pfad
Small Language Models
Bei manchen Sprachmodellen steht die Größe im Namen. Gemma 3 gibt es in fünf Fassungen, und die Bezugsseite zählt sie auf:
Available in 270M, 1B, 4B, 12B, and 27B parameter sizes (externe Seite, ollama.com)
270 Millionen bis 27 Milliarden Parameter, dieselbe Familie, ein Faktor 100 dazwischen. Bei ChatGPT, Claude und Gemini findet sich keine solche Zahl. Deren Stufen sind Preis- und Leistungsklassen, wie Grundkurs, Kapitel 10 beschreibt, und wie viele Parameter darin stecken, veröffentlicht keiner der drei Anbieter.
Dieses Kapitel handelt von der anderen Hälfte des Feldes: von den Modellen, bei denen die Zahl dasteht, und zwar von den kleinen darunter.
Ab wann ein Modell klein ist
Eine allgemein anerkannte Grenze in Parametern gibt es nicht, und die Quellen setzen sie verschieden an. Eine reine Parameterzahl lässt außerdem offen, was ein Gerät davon wirklich ausführen kann, und genau das verschiebt sich mit der Hardware. Belcak und sieben Mitautoren bei NVIDIA haben die Frage deshalb vom Modell auf das Gerät verlegt:
Nach dieser Arbeitsdefinition ist ein Modell klein, wenn es auf ein gewöhnliches Endgerät passt und dort einem einzelnen Nutzer schnell genug antwortet. Diese Bestimmung wandert mit der Hardware: Was 2023 einen Server verlangte, läuft heute auf einem Laptop.
Eine Hausnummer nennen die Verfasser trotzdem:
Dazu gehören zwei Hinweise. Die Arbeit ist ein Positionspapier von NVIDIA, also aus dem Haus, das die Rechenkarten für beide Größenklassen verkauft. Und die Verfasser führen ihre Bestimmung ausdrücklich als Arbeitsdefinition, mit dem eigenen Hinweis, ihre Wortwahl habe wenig Gewicht für den Kern ihrer Position.
Warum die Parameterzahl wenig über das Können sagt
2023 zeigte Metas Llama-Arbeit, was ein Größenunterschied wert sein kann:
LLaMA-13B outperforms GPT-3 (175B) on most benchmarks (externe Seite, arxiv.org)
13 Milliarden Parameter schlugen 175 Milliarden, gemessen an den meisten der untersuchten Auswertungen. Ein halbes Jahr später wiederholte sich das eine Nummer kleiner. Mistral veröffentlichte am 27.09.2023 ein Modell mit 7,3 Milliarden Parametern und schrieb dazu:
Die Klammer gehört dazu: Verglichen wird gegen Llama 1 34B, weil es die zweite Reihe in dieser Größe nie gab. Der geschlagene Gegner ist damit ein Jahr älter als der genannte.
Der Grund dafür liegt im Training und steht ausführlich in Beurteilen und Einordnen, Kapitel 05. In Kürze: Bis 2022 galt die Empfehlung, große Modelle zu bauen und das Training früh zu beenden. Die Chinchilla-Arbeit hat sie umgedreht: Bei festem Rechenbudget gehört zu doppelter Modellgröße die doppelte Datenmenge. Viele große Modelle jener Zeit hatten daran gemessen zu wenig Daten gesehen, und ein kleineres, dafür länger trainiertes Modell kann ein solches größeres schlagen.
Was die Parameterzahl weiterhin verlässlich sagt, ist etwas anderes: wie viel Speicher das Modell belegt. Wie viel davon gleichzeitig im Arbeitsspeicher liegen muss, hängt an der Bauform, dazu der Abschnitt über Apple weiter unten. Diese Rechnung führt Beurteilen und Einordnen, Kapitel 01 vor.
Zwei Wege führen zu einem kleinen Modell
Der eine leitet ab. Aus einem großen Modell entsteht ein kleineres, über Destillation oder als kleinere Fassung derselben Familie. Das ist der Regelfall, weil er bis zu vierzigmal weniger Trainingsmaterial kostet (externe Seite, arxiv.org). Auch das kleinste Gemma-Modell gehört dazu, es erbt Bauform und Vortraining der Familie (externe Seite, developers.googleblog.com).
Der andere baut von Grund auf, für ein Fachgebiet oder für die Sprachen, die gebraucht werden. Ein Modell mit 88 Millionen Parametern für das indische Rechtswesen schlägt bei seiner Aufgabe Modelle bis zum Achtzigfachen seiner Größe (externe Seite, arxiv.org). Eine Modellfamilie für das Kasachische (externe Seite, arxiv.org) entstand, weil mehrsprachige Modelle dieser Sprache wenig Kapazität einräumen und ihre Zerlegung schlecht zu deren Bau passt.
Beide haben dasselbe Bauteil eigens angefertigt, und es ist das Vokabular. Darin liegt der Hebel: Bei jenem kleinen Gemma-Modell entfallen 170 von 270 Millionen Parametern allein darauf, viele Sprachen und seltene Zeichenfolgen darstellen zu können. Wer zwei Sprachen braucht, verteilt dieselbe Zahl anders. Die Rechnung steht in Tiefe 2.
Wofür ein kleines Modell reicht
Der Abstand zur Spitze hängt an der Art der Aufgabe. Bei allem, was hauptsächlich Umformung ist, fällt er kaum ins Gewicht: zusammenfassen, umformulieren, sortieren, aus einem Text ein Feld herausziehen. Bei Aufgaben über viele Schritte, in denen ein früher Fehler alles Spätere verdirbt, wird er groß. Woran das liegt, steht in Beurteilen und Einordnen, Kapitel 01 unter der Frage, ob ein Modell läuft oder taugt.
Die Arbeit von NVIDIA setzt genau hier an. Ihre Beobachtung ist, dass die Aufgaben eines Agenten selten das breite Können verlangen, für das große Modelle gebaut sind:
Ein Agent, der hundertmal am Tag dieselbe Zuordnung trifft, braucht ein Modell, das diese eine Zuordnung beherrscht. Was ein solches Modell zusätzlich an Weltwissen mitbringt, bleibt in diesem Ablauf ungenutzt und wird trotzdem bezahlt.
Ein Modell im Telefon
Wie weit das inzwischen reicht, zeigt Apple. Die dritte Fassung der hauseigenen Modellreihe, vorgestellt am 08.06.2026, rechnet auf dem Gerät:
Interessant daran ist die Bauform des stärkeren der beiden Gerätemodelle:
Wo diese 20 Milliarden liegen, ist der eigentliche Punkt. Apple grenzt sich im selben Absatz von der üblichen Bauform ab, bei der alle Gewichte im Arbeitsspeicher stehen müssen:
Das vollständige Modell liegt also im Flash-Speicher, und in den Arbeitsspeicher wandert je Anfrage nur, was gebraucht wird. Aus einer Zahl werden damit drei: wie viel gespeichert ist, wie viel geladen wird und wie viel je Anfrage rechnet. Wie das technisch geht, steht in Tiefe 2. Die Angaben stammen vom Hersteller, eine unabhängige Messung dazu liegt nicht vor.
Wer selbst ausprobieren will, findet die verfügbaren Größen je Modell im Katalog von Ollama (externe Seite, ollama.com). Welche davon auf ein bestimmtes Gerät passen, rechnet Beurteilen und Einordnen, Kapitel 01 aus.
Woran Sie die Wahl festmachen
Fangen Sie bei der Aufgabe an, nicht bei der Größe. Eine enge, oft wiederholte Aufgabe ist der Fall, in dem ein kleines Modell mithält. Eine offene Frage mit vielen Schritten ist es nicht.
Fragen Sie nach mehr als einer Zahl. Die Gesamtgröße sagt, wie viel gespeichert werden muss. Wie viel davon gleichzeitig im Arbeitsspeicher liegen muss, hängt an der Bauform. Die aktive Größe sagt, wie viel je Anfrage gerechnet wird.
Messen Sie am eigenen Fall. Eine Benchmarkzahl beschreibt eine fremde Aufgabe. Was das bedeutet, steht in Beurteilen und Einordnen, Kapitel 04.
Halten Sie die Kette offen. Das kleine Modell zuerst, das große für die Fälle, an denen es scheitert. Diese Stufung ist der Regelfall im Betrieb, und was sie kostet, rechnet Tiefe 3 vor.
Ein Modell mit 7 Milliarden Parametern von 2026 kann mehr als eines mit 175 Milliarden von 2020. Diese Beobachtung wirft eine Frage auf, die sich beziffern lässt: Woher kommt der Zuwachs, wenn die Gewichte weniger geworden sind?
Es sind drei Entwicklungen, und sie wirken unabhängig voneinander.
Erstens, mehr Daten je Parameter
Bis 2022 galt die Empfehlung, das Rechenbudget vor allem in die Modellgröße zu stecken. Die Chinchilla-Arbeit hat sie umgedreht, und die Faustregel daraus gilt bei festem Rechenbudget: Zu doppelter Modellgröße gehört die doppelte Datenmenge. Die Messung und ihre Folgen stehen in Beurteilen und Einordnen, Kapitel 05.
Für kleine Modelle folgt daraus etwas Praktisches. Ein Modell mit 7 Milliarden Parametern, das nach der alten Regel trainiert worden wäre, hätte einen Bruchteil der Daten gesehen, die es heute bekommt. Der Zuwachs steckt also im Training, während die Datei gleich groß bleibt.
Zweitens, bessere Daten
Der zweite Weg setzt an der Auswahl an. Gunasekar und Mitautoren bei Microsoft haben 2023 gezeigt, wie weit sortierte Trainingsdaten reichen:
Vier Tage auf acht Rechenkarten, das ist die Größenordnung eines Universitätsinstituts. Das Ergebnis:
Zwei Einschränkungen gehören dazu. Die Arbeit misst Code, also eine eng umrissene Aufgabe mit einem klaren Maßstab; eine Übertragung auf offene Fragen folgt daraus nicht. Und ein Teil der Trainingsdaten stammt aus einem größeren Modell, womit das kleine Modell einen Teil seines Könnens von dort bezieht.
Drittens, Destillation
Damit ist der dritte Weg schon benannt. Ein großes Modell erzeugt die Antworten, ein kleines wird darauf abgestimmt. Wie das Verfahren arbeitet und was es kostet, steht in Beurteilen und Einordnen, Kapitel 02; dort steht auch die einzige Wirkungsangabe des Themas, die aus einer offengelegten Messung stammt, mit 40 Prozent weniger Größe bei 97 Prozent des erhaltenen Sprachverständnisses.
Für dieses Kapitel zählt die Richtung: Ein Teil dessen, was kleine Modelle können, ist aus großen Modellen übertragen worden. Der Abstand zwischen den Klassen schrumpft damit von oben.
Zwei Herkünfte eines kleinen Modells
Die drei Gründe oben nennen Verfahren. Darunter liegen zwei verschiedene Herkünfte, und bei der Auswahl ist der Unterschied wichtiger, als er klingt.
Der eine Weg leitet ab. Ein großes Modell ist da, und daraus entsteht ein kleineres: über Destillation, über das Beschneiden von Teilen, über eine kleinere Fassung derselben Familie. Warum das der Regelfall ist, hat NVIDIA beziffert:
Bis zu vierzigmal weniger Trainingsmaterial. So entstehen die Modellfamilien, und so entstand auch das kleinste Gemma-Modell:
Es ist damit ein Ableger und ein Ausgangspunkt zugleich, gedacht zum Feinjustieren auf die eigene Aufgabe. Das große Vokabular von 256.000 Einträgen hält es dafür offen, statt es auf ein Fach festzulegen.
Der andere Weg baut von Grund auf. Das Modell entsteht für ein Fachgebiet oder für eine Sprache, mit einem eigens dafür gebauten Vokabular, und die geringe Größe ist eine Folge dieses Zuschnitts. Ein Beispiel aus dem Rechtswesen:
88 Millionen Parameter, 185 Stunden auf einer Rechenkarte, ein eigenes Vokabular für das Fach. Bei der Aufgabe, für die es gebaut wurde:
Derselbe Zuschnitt geht über Sprachen. Eine Modellfamilie von 50 bis 600 Millionen Parametern für das Kasachische nennt ihren Anlass im ersten Satz:
Mehrsprachige Modelle geben einer solchen Sprache wenig Kapazität, und ihre Zerlegung passt schlecht zu deren Bau. Das Ergebnis ist von Grund auf trainiert, auf 9 Milliarden Zeichenketten kasachischen Textes, mit einem eigenen Vokabular aus 50.000 Einträgen (externe Seite, arxiv.org).
Beide Arbeiten haben dasselbe Bauteil eigens angefertigt, und das führt zur nächsten Rechnung.
Wie viel ein Vokabular kostet
Die Rechnung dahinter macht der Hersteller selbst auf, und sie ist die lehrreichste Zahl dieses Kapitels:
170 von 270 Millionen Parametern stecken im Vokabular, 100 Millionen in den Rechenschichten. Bei diesem Modell entfallen also knapp zwei Drittel der Parameter auf die Fähigkeit, viele Sprachen und seltene Zeichenfolgen darzustellen. Was davon Sprachverständnis erzeugt, ist der kleinere Teil.
Daraus folgt der Hebel, den ein gezielt gebautes Modell hat. Wer zwei Sprachen und ein Fachgebiet braucht, kommt mit einem kleineren Vokabular aus und kann dieselbe Parameterzahl anders verteilen. Ein allgemeines Modell muss die Sprachen der Welt vorhalten, ein Fachmodell ist davon frei.
Diese Rechnung gilt über das eine Modell hinaus. Eine Arbeit von 2026 nennt die Regel dahinter samt ihrer Folge:
Ein Modell für das Gerät fährt also ein kleines Vokabular und nimmt in Kauf, dass Sprachen außerhalb seines Zuschnitts in viele Bruchstücke zerfallen. Wer ein solches Modell in einer Sprache einsetzt, die beim Bau keine Rolle spielte, zahlt das bei jeder Anfrage mit.
Nebenbei klärt die Zahl einen Begriff. Parameter und Gewichte werden oft gleichgesetzt, und bei diesem Modell liegen zwei Drittel der Parameter in einer Tabelle statt in den Gewichtsmatrizen der Schichten. Wer eine Parameterzahl liest, weiß deshalb noch nicht, wie viel Rechenwerk dahintersteht.
Wann sich der Zuschnitt lohnt
Die Wahl zwischen den beiden Wegen ist gemessen worden, und zwar früh. Eine Arbeit bei Microsoft prüfte 2020 die damals verbreitete Erwartung:
Das Ergebnis fiel anders aus, und der Bedingungssatz darin ist der eigentliche Befund:
Für Gebiete mit reichlich unmarkiertem Text also. Wo dieser Text fehlt, bleibt der Weg über ein vorhandenes Modell der bessere, und das ist die Mehrzahl der Fälle. Zwei Einschränkungen gehören dazu: Die Arbeit stammt aus der Zeit vor den heutigen erzeugenden Modellen und misst eine ältere Bauform, und sie misst ein einziges Fachgebiet. Das Beispiel aus dem Rechtswesen oben zeigt denselben Befund bei einem erzeugenden Modell; eine Regel für jedes Fach folgt aus zwei Arbeiten nicht.
Der Kniff, der die Rechnung verschiebt
Neben dem Training hat sich die Bauform geändert. In einem Mixture-of-Experts-Modell liegen alle Gewichte auf dem Gerät, gerechnet wird je Token aber nur mit einem Teil davon. Aus einer Zahl werden dadurch zwei.
Zwei Beispiele aus dem Jahr 2026 zeigen die Spanne. NVIDIAs Nemotron 3.5 Lightning (externe Seite, huggingface.co) führt in seiner Modellkarte 30 Milliarden Parameter insgesamt und 3 Milliarden aktive, abgerufen am 04.09.2026.
Bei dieser Bauform beantworten die zwei Zahlen verschiedene Fragen. Die Gesamtzahl sagt, wie viel Arbeitsspeicher belegt wird, also ob das Modell auf das Gerät passt; diese Rechnung führt Beurteilen und Einordnen, Kapitel 01 vor. Die aktive Zahl sagt, wie viel je Token gelesen und gerechnet wird, also wie schnell die Antwort kommt. Ein Modell mit 30 Milliarden gesamt und 3 aktiven verhält sich damit beim Platzbedarf wie ein großes und bei der Antwortzeit wie ein kleines.
Apples Bauform bricht auch mit dieser Rechnung
Das stärkere der beiden Apple-Gerätemodelle sieht auf den ersten Blick genauso aus:
Der Absatz darüber grenzt sich allerdings ausdrücklich von der eben beschriebenen Bauform ab. Bei den üblichen Modellen müssen alle Gewichte im Arbeitsspeicher stehen, und Apple geht einen anderen Weg:
Der Grund dafür ist eine Eigenschaft der Hardware, und er erklärt zugleich, warum die Wahl der Experten je Anfrage fällt statt je Token:
Damit zerfällt die Parameterzahl in drei Größen statt zwei. Gespeichert sind 20 Milliarden, und zwar im Flash-Speicher. Geladen wird je Anfrage nur der Teil, den die gewählten Experten brauchen. Gerechnet wird mit 1 bis 4 Milliarden. Apple nennt als Zweck ausdrücklich, damit über die Grenze des Arbeitsspeichers hinauszukommen:
Wer zwei Modelle vergleicht, muss deshalb zweierlei wissen: welche der Zahlen angegeben ist, und welche Bauform dahintersteht. Der Satz, die Gesamtzahl sage den Bedarf an Arbeitsspeicher, gilt für Nemotron und für die üblichen offenen Modelle. Für dieses Apple-Modell gilt er nicht.
Wo die Bezeichnung Werbung wird
Genau hier wird der Begriff dehnbar. Kimi K3 rechnet nach seiner Modellkarte (externe Seite, huggingface.co) mit 104 Milliarden aktiven Parametern von 2,8 Billionen insgesamt. Nach dem Verhältnis sieht das sparsam aus. Die Gewichte wiegen zusammen 1,56 Terabyte, und was das für den Betrieb bedeutet, rechnet der Beitrag Was offene Gewichte wert sind, wenn sie 1,56 Terabyte wiegen vor. Ein Anteil allein sagt also nichts über die Klasse.
Die Bestimmung aus Tiefe 1 hält dem stand, weil sie am Gerät ansetzt statt an einem Verhältnis. Gewichte im Umfang von 1,56 Terabyte passen auf kein Gerät im Haushalt, weder in den Arbeitsspeicher noch in den Flash-Speicher, und daran ändert der Anteil der aktiven Parameter nichts.
Spezialisiert statt allgemein
Der Zuschnitt beim Bauen hat ein Gegenstück beim Einsatz. Wenn ein Ablauf immer dieselbe enge Aufgabe stellt, ist das breite Wissen eines großen Modells totes Gewicht. Genau das ist das Hauptargument der NVIDIA-Arbeit über Agenten (externe Seite, arxiv.org), und der Zuschnitt ist an den Modellnamen ablesbar: Nemotron 3.5 Lightning ist ausdrücklich für lang laufende Agenten gebaut.
Dieselbe Überlegung steckt an mehreren Stellen der Seite, ohne dort so zu heißen. Ein Wächtermodell vor dem eigentlichen Modell ist ein spezialisiertes kleines Modell, siehe Conversational AI, Kapitel 07. Ein Embedding-Modell ist eines, und ein Erkennungsmodell für gesprochene Sprache ebenfalls, siehe Conversational AI, Kapitel 02. Kleine Modelle sind im Betrieb seit Jahren üblich, unter anderen Namen.
Was der Katalog hergibt
Wer Größen vergleichen will, findet sie im Modellkatalog von Ollama (externe Seite, ollama.com). Je Eintrag stehen die verfügbaren Parametergrößen, das Datum der letzten Fassung und Merkmale wie Vision oder Werkzeugaufrufe. Das ist die schnellste Antwort auf die Frage, welche Größen es zu einem Modellnamen überhaupt gibt.
Zwei Auskünfte fehlen dort. Erstens sagt der Katalog nichts über die Güte, dazu braucht es eine Messung am eigenen Fall, siehe Beurteilen und Einordnen, Kapitel 04. Zweitens führt er allein Modelle mit offenen Gewichten; die Größen der geschlossenen Spitzenmodelle bleiben unveröffentlicht, was Grundkurs, Kapitel 10 beschreibt.
Was daraus für die Praxis folgt
Der Abstand zwischen klein und groß ist über die Zeit kleiner geworden, und zwar bei einer bestimmten Sorte von Aufgabe. Mistral hat das 2023 für die eigene Klasse beziffert:
Outperforms Llama 1 34B on many benchmarks (externe Seite, mistral.ai)
Der Satz beschreibt eine Auswertung gegen ein zwei Jahre älteres Modell und sagt nichts über den Abstand zur jeweils aktuellen Spitze. Dieser Abstand besteht weiter, er verläuft nur woanders: bei Aufgaben über viele Schritte, bei breitem Weltwissen und bei sehr langen Eingaben. Wo genau er kippt, misst Tiefe 3.
Die Zahl, die in dieser Diskussion am häufigsten fällt, stammt aus der NVIDIA-Arbeit: Ein Modell mit 7 Milliarden Parametern sei im Betrieb 10- bis 30-mal günstiger als eines mit 70 bis 175 Milliarden, gemessen in Antwortzeit, Energieverbrauch und Rechenoperationen (Abschnitt 3.2 (externe Seite, arxiv.org), abgerufen am 04.09.2026).
Diese Zahl verlangt eine Nebenrechnung, bevor man mit ihr arbeitet. Die verglichenen Größen liegen um den Faktor 10 bis 25 auseinander. Der genannte Vorteil von 10 bis 30 entspricht also ungefähr dem Größenverhältnis selbst. Die Angabe belegt damit, dass die Kosten ungefähr mit der Größe fallen. Mehr steht in ihr. Dazu kommt die Herkunft: Die Arbeit ist ein Positionspapier eines Herstellers von Rechenkarten, und eine unabhängige Nachmessung dieser Spanne liegt nicht vor.
Die Bauform schlägt die Größe, gemessen
Belastbarer ist eine Messung am eigenen Gerät, weil dort alle Größen bekannt sind. Am 17.08.2026 sind zwei Modelle mit praktisch gleicher Dateigröße gegeneinander gelaufen: eines mit 27,78 Milliarden Parametern, die bei jedem Token alle rechnen, gegen ein Mixture-of-Experts-Modell mit rund vier Milliarden aktiven. Faktor 6,4 in der Antwortzeit, zugunsten des zweiten. Der Aufbau, die Streuung und die übrigen Zahlen stehen im Bericht Elf Wege, ein lokales Modell schneller zu machen.
Daraus folgt eine Faustregel für die Auswahl. Bei zwei Modellen gleicher Dateigröße, die beide vollständig im Arbeitsspeicher liegen, entscheidet die aktive Parameterzahl über die Antwortzeit, und der Abstand kann eine Größenordnung betragen. Wer allein auf die Dateigröße sieht, wählt an der Kennzahl vorbei, die er eigentlich meint.
Die Bedingung im Nebensatz ist keine Förmlichkeit. Apples Gerätemodell lädt seine Gewichte aus dem Flash-Speicher nach, und dort verläuft der Engpass zwischen Flash und Arbeitsspeicher statt innerhalb des Arbeitsspeichers. Die Rechnung dazu steht in Tiefe 2.
Eine Einschränkung gehört dazu, und sie ist im Bericht beziffert: Die Geschwindigkeit schwankt auf einem Arbeitsrechner im Mittel um 22 Prozent. Ein gemessener Unterschied ist erst ab einer Schwelle eine Aussage, und diese Schwelle misst man an der eigenen Streuung, bevor man Modelle vergleicht.
Die Kette, und was sie wirklich spart
Der übliche Bau im Betrieb ist eine Stufung: Das kleine Modell nimmt jede Anfrage entgegen, das große übernimmt die Fälle, an denen es scheitert. Zwei Ausprägungen davon stehen an anderer Stelle, ein Wächtermodell vor dem eigentlichen Modell in Conversational AI, Kapitel 07 und die Ausweichkette vom Anbieter zum lokalen Modell in Beurteilen und Einordnen, Kapitel 01.
Was eine solche Kette einspart, hängt an einer einzigen Größe, die selten gemessen wird: dem Anteil der Anfragen, den die erste Stufe abschließt. Bei 90 Prozent übernimmt die zweite Stufe ein Zehntel der Last, bei 50 Prozent die Hälfte. Und die Kette kostet auch dort, wo sie nichts einspart, denn eine weitergereichte Anfrage ist zweimal bezahlt worden.
Daraus folgt die Reihenfolge beim Bauen. Zuerst wird der Anteil gemessen, dann gerechnet, ob sich die Stufung lohnt. Eine Kette, deren erste Stufe 40 Prozent schafft, kostet mehr als der direkte Weg zum großen Modell.
Wo der Abstand bleibt
Die Arbeit, die für kleine Modelle argumentiert, führt die Gegenposition selbst auf und benennt sie ohne Abschwächung:
Der entscheidende Zusatz steht im Satz: derselben Generation. Genau daran hängt der Unterschied zwischen den beiden Aussagen dieses Kapitels. Ein kleines Modell von heute schlägt ein großes von vorgestern, und das ist gemessen. Ein kleines Modell schlägt ein großes desselben Jahrgangs bei allgemeiner Sprache nicht, und das ist ebenfalls gemessen. Beide Sätze stehen nebeneinander, ohne sich zu widersprechen.
Praktisch heißt das: Der Vergleich, der zählt, ist der gegen die heutige Spitze. Ein Modell von 2020 als Maßstab sagt über eine Wahl von heute wenig. Wer eine Ankündigung liest, sieht zuerst nach, gegen welchen Jahrgang gemessen wurde.
Drei Stellen, an denen es kippt
Bei Aufgaben über viele Schritte. Ein Fehler am Anfang verdirbt alles Spätere, und die Fehlerquote je Schritt multipliziert sich. Die Rechnung dazu steht in Grundkurs, Kapitel 10.
Bei breitem Weltwissen. Was ein Modell aus dem Training weiß, hängt an seiner Größe, und ein kleines Modell hat weniger davon. Der übliche Ausweg ist, das Wissen zur Laufzeit danebenzustellen, siehe Agenten und Harness, Kapitel 03. Das verschiebt die Anforderung vom Wissen zum Verstehen der mitgelieferten Belege.
Bei der Nutzung langer Eingaben. Die nominelle Kontextlänge ist dabei die falsche Kennzahl: Nemotron 3.5 Lightning nennt in seiner Modellkarte (externe Seite, huggingface.co) bis zu einer Million Token, abgerufen am 04.09.2026. Wie gut ein Modell die Mitte einer langen Eingabe verwertet, ist eine andere Frage, und die Arbeiten dazu stehen in Grundkurs, Kapitel 05. Ob der Abstand dabei an der Modellgröße hängt, sagt keine der hier geführten Arbeiten.
Was daraus nicht folgt
Dass ein kleines Modell billiger ist. Es ist billiger je Aufruf. Wer deshalb mehr Aufrufe macht oder Fälle weiterreicht, kann teurer herauskommen. Die Rechnung steht oben.
Dass die Parameterzahl gar nichts sagt. Sie sagt weiterhin, wie viel Speicher die Gewichte belegen, und in der aktiven Variante, wie viel je Anfrage gerechnet wird. Ob dieser Speicher der Arbeitsspeicher sein muss, hängt an der Bauform, siehe Tiefe 2. Was die Zahl nicht mehr sagt, ist die Güte.
Dass ein kleines Modell die geschrumpfte Fassung eines großen ist. Das gilt für den einen der beiden Wege, und er ist der häufigere, weil er bis zu vierzigmal weniger Trainingsmaterial kostet (externe Seite, arxiv.org). Der andere baut von Grund auf für ein Fachgebiet und für bestimmte Sprachen, und dort ist die geringe Größe eine Folge des Zuschnitts. Für die Auswahl heißt das: Vor dem Vergleich zweier kleiner Modelle gehört die Frage, wofür sie gebaut wurden. Ein zugeschnittenes Modell schlägt in seinem Fach ein allgemeines derselben Größe, und außerhalb davon verliert es deutlicher.
Dass sortierte Trainingsdaten die Größe ersetzen. Die Phi-Arbeit misst Code, also eine eng umrissene Aufgabe mit einem klaren Maßstab (Nachweis (externe Seite, arxiv.org)). Eine Übertragung auf offene Fragen folgt daraus nicht.
Dass ein Modell auf dem Gerät ein Datenschutzversprechen ist. Es ist eines, solange nichts das Gerät verlässt. Apple beschreibt für die eigene Reihe ausdrücklich zwei Orte:
Welcher der beiden Orte greift, entscheidet das System. Was ein Betreiber zusagt und woran man das festmacht, steht in Beurteilen und Einordnen, Kapitel 01.
Dass die Klasse stabil ist. Die Bestimmung aus Tiefe 1 hängt am Gerät, und Geräte werden größer. Was heute ein kleines Modell heißt, ist in zwei Jahren eine andere Größe. Das Kapitel wird deshalb alle 60 Tage nachgesehen.
Quellen
15 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Dokumentationerreichbar
Ollama, Modellseite Gemma 3 (externe Seite, ollama.com)
ollama.comgeprüft 24.09.2026
Die Bezugsseite der Dateien, und damit der Beleg dafür, wie groß ein herunterladbares Modell wirklich ist. Sie führt fünf Größen von 270 Millionen bis 27 Milliarden Parametern und nennt je Variante die Dateigröße in der voreingestellten Quantisierung: 3,3 GB für die 4B-Fassung, 8,1 GB für 12B und 17 GB für 27B, abgerufen am 05.08.2026. Die Zahlen stehen in einer Auswahltabelle und lassen sich deshalb nicht als Satz zitieren.
Originalarbeiterreichbar
Small Language Models are the Future of Agentic AI (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Belcak und sieben Mitautoren bei NVIDIA legen am 02.06.2025 dar, warum kleine Sprachmodelle für Agenten die passendere Wahl sind. Wichtig daran ist die Bestimmung von klein, die ohne willkürliche Parametergrenze auskommt: Sie geht über das Gerät und über die Antwortzeit für einen einzelnen Nutzer. Als Faustzahl für 2025 nennen die Verfasser 10 Milliarden Parameter. Die Arbeit ist ausdrücklich ein Positionspapier, und ihre Wirkungsangaben stammen vom Hersteller der Rechenkarten, auf denen solche Modelle laufen.
Originalarbeiterreichbar
LLaMA: Open and Efficient Foundation Language Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Touvron und Mitautoren stellen am 27.02.2023 eine Modellreihe vor, deren Gewichte an Forschende herausgegeben werden. Damit beginnt der offene Branch: Von hier an gibt es zu jedem geschlossenen Modell eine Alternative, die man selbst betreiben kann.
Ankündigung des Herstellerserreichbar
Mistral 7B (externe Seite, mistral.ai)
mistral.aigeprüft 24.09.2026
Das erste Modell von Mistral AI, veröffentlicht am 27.09.2023 unter Apache 2.0 mit herunterladbaren Gewichten. Es schlug in den Auswertungen das fast doppelt so große Llama 2 13B und ist der Anfang der europäischen Reihe, die bis heute läuft.
Ankündigung des Herstellerserreichbar
machinelearning.apple.comgeprüft 24.09.2026
Apple stellt am 08.06.2026 die dritte Fassung seiner Modellreihe vor. Das stärkere der beiden Modelle auf dem Gerät hat 20 Milliarden Parameter und rechnet je Anfrage mit 1 bis 4 davon. Der Absatz dazu grenzt sich ausdrücklich von den üblichen Mixture-of-Experts-Modellen ab: Dort liegen alle Gewichte im Arbeitsspeicher, hier liegt das vollständige Modell im Flash-Speicher, und die benötigten Experten wandern je Anfrage in den Arbeitsspeicher. Damit zerfällt die Parameterzahl in vier Größen, nämlich gespeichert, geladen, aktiv und gerechnet. Die Angaben sind Herstellerangaben, eine unabhängige Messung dazu gibt es nicht.
Werkzeugerreichbar
Ollama, Modellkatalog (externe Seite, ollama.com)
ollama.comgeprüft 24.09.2026
Die Liste der Modelle, die sich mit einem Befehl auf den eigenen Rechner holen lassen. Je Eintrag stehen die verfügbaren Parametergrößen, die Zahl der Abrufe, das Datum der letzten Fassung und Merkmale wie vision, tools oder thinking. Das Programm dazu steht unter ollama-werkzeug; diese Adresse beantwortet die andere Frage, nämlich welche Modelle es überhaupt gibt und in welchen Größen.
Ankündigung des Herstellerserreichbar
Google, Introducing Gemma 3 270M (externe Seite, developers.googleblog.com)
developers.googleblog.comgeprüft 24.09.2026
Google stellt am 14.08.2025 ein Modell mit 270 Millionen Parametern vor, das von Anfang an auf den Zuschnitt für eine Aufgabe gebaut ist. Der Eintrag steht hier wegen einer Zahl: 170 der 270 Millionen Parameter stecken im Vokabular und nur 100 Millionen in den Rechenschichten. Damit ist zweierlei belegt, dass Parameterzahl und Gewichte verschiedene Dinge sind, und dass ein Vokabular für viele Sprachen einen erheblichen Teil eines kleinen Modells beansprucht. Die Angaben stammen vom Hersteller.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Niyogi, Gaussier und Bhattacharya fragen am 20.03.2024, ob ein von Grund auf trainiertes Kleinstmodell ein großes ersetzen kann, und beantworten das am indischen Rechtswesen. Ihr Modell mit 88 Millionen Parametern entstand in 185 A100-Stunden und bekam ein eigenes, auf das Fachgebiet zugeschnittenes Vokabular. Bei der Vorhersage von Urteilen schlägt es Modelle bis zum Achtzigfachen seiner Größe. Die zuletzt am 16.03.2026 überarbeitete Fassung zeigt, dass der Zuschnitt schon beim Bauen geschehen kann statt erst beim Feinjustieren.
Originalarbeiterreichbar
Compact Language Models via Pruning and Knowledge Distillation (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Muralidharan und Mitautoren bei NVIDIA beziffern am 19.07.2024 den Abstand zwischen den beiden Bauwegen. Ein 8- und ein 4-Milliarden-Modell aus einem vorhandenen 15-Milliarden-Modell abzuleiten kostet bis zu vierzigmal weniger Trainingstoken, als beide von Grund auf zu trainieren. Das ist der Grund, warum Modellfamilien überwiegend so entstehen, und zugleich die Zahl, gegen die ein zugeschnittenes Modell antreten muss.
Originalarbeiterreichbar
SozKZ: Training Efficient Small Language Models for Kazakh from Scratch (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Tukenov trainiert am 21.03.2026 eine Modellfamilie von 50 bis 600 Millionen Parametern von Grund auf für das Kasachische, mit einem eigenen Vokabular aus 50.000 Einträgen. Die Begründung nennt die Arbeit im ersten Satz: Mehrsprachige Modelle geben einer solchen Sprache wenig Kapazität, und ihre Zerlegung passt schlecht zu deren Bau. Das 600-Millionen-Modell erreicht bei kasachischen Aufgaben, was doppelt so große mehrsprachige Modelle erreichen, gemessen an drei Prüfsammlungen gegen fünf Vergleichsmodelle.
Originalarbeiterreichbar
Textbooks Are All You Need (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Gunasekar und Mitautoren bei Microsoft zeigen am 20.06.2023, dass sortierte Trainingsdaten einen Teil der Modellgröße ersetzen. Ihr Modell mit 1,3 Milliarden Parametern entstand in vier Tagen auf acht Rechenkarten und erreicht 50,6 Prozent auf HumanEval. Die Arbeit misst allein Code, also eine eng umrissene Aufgabe, und ein Teil ihrer Trainingsdaten stammt aus einem größeren Modell. Beides gehört zu jeder Übertragung auf andere Gebiete dazu.
Dokumentationerreichbar
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 · Hugging Face (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Modellkarte mit Parameterzahl, Architektur, Lizenz und Veröffentlichungsdatum des Modells.
Originalarbeiterreichbar
Kimi K3, Modellkarte auf Hugging Face (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Die Modellkarte zum offenen Modell Kimi K3 von Moonshot AI, veröffentlicht am 27.07.2026. Nennt den Aufbau (Mixture of Experts, 2,8 Billionen Parameter gesamt, 104 Milliarden je Token aktiv), Kontextfenster, Quantisierung und die vollständige Auswertungstabelle gegen die geschlossenen Spitzenmodelle. Die Gewichte liegen im selben Verzeichnis, 96 Dateien mit zusammen 1,56 Terabyte.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Gu und Mitautoren bei Microsoft prüfen am 31.07.2020 die verbreitete Annahme, ein Fachmodell fahre am besten, wenn es von einem allgemeinen Modell ausgeht. Für Gebiete mit viel unmarkiertem Text messen sie das Gegenteil: Ein von Grund auf auf Fachtexten trainiertes Modell gewinnt deutlich gegenüber der Weiterführung eines allgemeinen. Die Bedingung steht im Befund selbst, und die Arbeit stammt aus der BERT-Zeit, misst also Encoder-Modelle im biomedizinischen Bereich.
Originalarbeiterreichbar
In-Place Tokenizer Expansion for Pre-trained LLMs (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Smith und Mitautoren zeigen am 16.07.2026, warum ein kleines Modell beim Vokabular sparen muss. Bei einem Modell in der Cloud fallen die Tabellen für Vokabular und Ausgabeschicht kaum ins Gewicht, bei einem kompakten Modell bestimmen sie einen erheblichen Teil der Bandbreite je Zeichenkette. Modelle für das Gerät fahren deshalb kleine Vokabulare und nehmen in Kauf, dass Sprachen außerhalb ihres Zuschnitts in viele Bruchstücke zerfallen. Nach einer Erweiterung messen die Autoren für Hindi und Vietnamesisch rund 2,4- und 2,6-fach weniger Zeichenketten.