Was offene Gewichte wert sind, wenn sie 1,56 Terabyte wiegen
Kimi K3 ist herunterladbar und praktisch von niemandem allein zu betreiben. Beides stimmt gleichzeitig, und der Widerspruch löst sich auf, sobald man aufhört, offen mit lokal zu verwechseln.
Am 27. Juli 2026 hat Moonshot AI die Gewichte von Kimi K3 veröffentlicht. Wer will, lädt 96 Dateien mit zusammen 1,56 Terabyte herunter und hat damit dasselbe Modell auf der Platte, das der Hersteller über seine Schnittstelle verkauft. Nach den Zahlen der Modellkarte liegt es gleichauf mit den besten geschlossenen Modellen.
Der erste Reflex darauf lautet: schön, aber wer soll das laufen lassen. Der Reflex ist berechtigt und führt trotzdem in die Irre, weil er offen mit lokal gleichsetzt. Das sind zwei verschiedene Dinge, und der Unterschied ist genau das, was an dieser Veröffentlichung zählt.
Warum die Dateien nur 1,56 Terabyte wiegen
2,8 Billionen Parameter, 1,56 Terabyte: Das sind 0,56 Byte je Parameter, also knapp viereinhalb Bit. Ein Modell, das üblich in 16 Bit je Parameter trainiert und ausgeliefert wird, käme auf gut 5,6 Terabyte.
Der Unterschied ist kein Nachbearbeitungstrick. Die Modellkarte nennt ihn beim Namen: „Kimi K3 applies quantization-aware training from the SFT stage onward, using MXFP4 weights with MXFP8 activations for broad hardware compatibility.“ Das Modell wurde also ab dem Fine-Tuning so trainiert, dass es die grobe Zahlendarstellung verträgt, statt sie hinterher aufgezwungen zu bekommen. Wer erst trainiert und dann schrumpft, verliert Genauigkeit an einer Stelle, die er sich nicht ausgesucht hat. Wer von Anfang an mit der groben Darstellung rechnet, verteilt den Verlust dorthin, wo das Training ihn verkraftet.
Für den Betrieb heißt das: Die 1,56 Terabyte sind bereits die sparsame Fassung. Viel weiter herunter geht es nicht, ohne dass jemand anderes das Modell erneut beschneidet und dabei die Ergebnisse verändert, für die die Auswertungstabelle steht.
Wer das betreiben kann
Ein Mixture of Experts rechnet je Token nur einen Teil seiner selbst: 16 von 896 Experten, 104 Milliarden aktive Parameter von 2,8 Billionen. Das spart Rechenzeit, aber keinen Speicher. Welcher Experte als Nächstes gebraucht wird, weiß man vorher nicht, also müssen alle erreichbar sein.
Damit steht die Anforderung fest, und sie ist eine Speicheranforderung. 1,56 Terabyte wollen gehalten werden, dazu kommt der Cache für das Kontextfenster, und das ist bei einer Million Token nicht klein. In der Größenordnung von zwanzig Beschleunigerkarten mit je 80 Gigabyte ist man dabei, in einem Rechner mit 64 oder 128 Gigabyte Arbeitsspeicher nicht ansatzweise. Auf einem gut ausgestatteten Arbeitsplatzrechner laufen Modelle mit sieben bis siebzig Milliarden Parametern in grober Zahlendarstellung, also zwischen vier und vierzig Gigabyte. Zwischen dem, was zu Hause läuft, und dem, was hier veröffentlicht wurde, liegen zwei Größenordnungen.
Das Modell empfiehlt selbst drei Laufzeitumgebungen für den Betrieb, alle drei für Serverhardware. Ein Angebot für den Schreibtisch ist nicht darunter, und diese Liste stammt vom Hersteller selbst.
Was offen dann praktisch heißt
Bleibt die Frage, was jemand davon hat, der die Dateien nie selbst öffnet. Vier Dinge, und keines davon setzt eigene Hardware voraus.
Das Modell kann nicht mehr verschwinden. Ein Anbieter, der ein Modell über seine Schnittstelle verkauft, kann es abschalten, ersetzen oder still nachjustieren. Wer die Gewichte hat, hat den Stand vom 27. Juli 2026, und der bleibt, was er ist. Für jeden, der Ergebnisse reproduzieren muss, ist das der Unterschied zwischen Prüfbarkeit und Vertrauen.
Es gibt mehr als einen Betreiber. Dieselben Gewichte lassen sich bei verschiedenen Anbietern laufen lassen, und die konkurrieren um den Preis derselben Sache. Beim geschlossenen Modell verhandelt man mit einem Anbieter über sein Modell, beim offenen mit mehreren über dasselbe.
Der Ort der Verarbeitung wird wählbar. Wer aus rechtlichen Gründen festlegen muss, wo Daten verarbeitet werden, kann einen Betreiber danach aussuchen oder das Modell im eigenen Rechenzentrum aufsetzen. Die Frage verschiebt sich von „nimmt der Anbieter das in seine Bedingungen auf“ zu „was kostet mich das“.
Der Ausstieg ist rechenbar. Eine der fünf Fragen, die vor einem KI-Projekt zu klären sind, lautet: Was kostet der Ausstieg, wenn der Anbieter Preis oder Modell ändert. Bei offenen Gewichten hat diese Frage zum ersten Mal eine Antwort, die nicht vom Anbieter abhängt.
Die Lizenz, und wo sie zubeißt
„Offen“ ist kein geschützter Begriff, deshalb lohnt der Blick in die Lizenz. Die Kimi K3 License liest sich über weite Strecken wie die MIT-Lizenz: benutzen, kopieren, ändern, weitergeben, verkaufen, nachtrainieren. Zwei Bedingungen kommen hinzu.
Wer Modellzugang als Dienst anbietet, also Dritten Inferenz oder Fine-Tuning zur Verfügung stellt, und dabei über zwölf Monate mehr als 20 Millionen US-Dollar umsetzt, braucht eine eigene Vereinbarung mit Moonshot. Und wer das Modell in einem Produkt mit mehr als 100 Millionen monatlich aktiven Nutzern einsetzt, muss den Namen sichtbar nennen.
Beides zielt auf große Anbieter. Die Lizenz sagt ausdrücklich, dass die Bedingungen für den internen Gebrauch nicht gelten: „do not apply to: (a) internal use of the Software“. Für einen Mittelständler, der das Modell für sich betreibt oder betreiben lässt, ist die Lizenz damit so frei wie MIT. Für einen Anbieter, der darauf ein Geschäft baut, ist sie es ab einer bestimmten Größe nicht mehr.
Das ist ein anderes Modell als bei den Llama-Lizenzen, die eine Nutzerobergrenze für den Einsatz selbst kannten. Hier ist der Einsatz frei, der Weiterverkauf ab einer Umsatzschwelle nicht.
Was die Auswertungstabelle nicht hergibt
Die Modellkarte listet über vierzig Vergleichsmaße gegen fünf geschlossene Modelle. Kimi K3 gewinnt einige, verliert einige, und die Abstände sind durchweg klein: 93,5 gegen 94,1 beim naturwissenschaftlichen Fragenkatalog GPQA Diamond, 88,3 gegen 88,8 bei Terminal-Bench.
Drei Einschränkungen gehören dazu, und sie stehen hier, weil sie in der Tabelle nicht stehen.
Erstens hat der Hersteller gemessen, nicht ein Dritter. Zweitens sagt ein Abstand von einem halben Punkt bei diesen Verfahren wenig: Solche Kataloge haben eine Streuung, die selten mitveröffentlicht wird, und wer oft genug misst, gewinnt irgendwann. Drittens sind die Kataloge dort, wo alle Teilnehmer über 90 Prozent liegen, als Unterscheidungswerkzeug am Ende. Sie messen dann noch, wer die letzten schweren Fälle trifft, und das sind oft Fälle, die niemand hat.
Belastbar ist an diesen Zahlen die Größenordnung. Wer vorn liegt, wechselt mit dem Katalog; dass ein offen verfügbares Modell überhaupt in derselben Liga gemessen wird, wechselt nicht mehr. Vor achtzehn Monaten war der Abstand ein Jahr, bei DeepSeek R1 im Januar 2025 waren es Monate. Jetzt sind es Wochen.
Was daraus folgt
Der Engpass wandert. Solange offene Modelle deutlich schlechter waren, lautete die Frage: Welches Modell nehme ich. Diese Frage ist für viele Anwendungen beantwortet, und zwar mit „mehrere kommen infrage“. Die nächste Frage lautet: Wer betreibt es, zu welchem Preis, an welchem Ort, und was passiert, wenn dieser Betreiber ausfällt.
Das ist eine Betriebsfrage, keine Modellfrage. Wer heute über KI im Unternehmen entscheidet, entscheidet zunehmend über Infrastruktur und Verträge. Die 1,56 Terabyte sind dabei eine Preisangabe.
Quellen
5 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Originalarbeiterreichbar
Kimi K3, Modellkarte auf Hugging Face (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Die Modellkarte zum offenen Modell Kimi K3 von Moonshot AI, veröffentlicht am 27.07.2026. Nennt den Aufbau (Mixture of Experts, 2,8 Billionen Parameter gesamt, 104 Milliarden je Token aktiv), Kontextfenster, Quantisierung und die vollständige Auswertungstabelle gegen die geschlossenen Spitzenmodelle. Die Gewichte liegen im selben Verzeichnis, 96 Dateien mit zusammen 1,56 Terabyte.
Ankündigung des Herstellerserreichbar
Kimi K3: Open Frontier Intelligence (externe Seite, kimi.com)
kimi.comgeprüft 24.09.2026
Die Ankündigung von Moonshot AI vom 17.07.2026, zehn Tage vor der Freigabe der Gewichte. Beschreibt die beiden Neuerungen am Aufbau, Kimi Delta Attention und Attention Residuals, und beziffert den Gewinn an Skalierungseffizienz gegenüber dem Vorgänger K2.
Originalarbeiterreichbar
Kimi K3 License (externe Seite, huggingface.co)
huggingface.cogeprüft 24.09.2026
Die Lizenz der Gewichte. Sie liest sich wie die MIT-Lizenz und hat zwei Schwellen: Wer Modellzugang als Dienst verkauft und dabei über 20 Millionen US-Dollar in zwölf Monaten umsetzt, braucht eine eigene Vereinbarung; wer über 100 Millionen monatlich aktive Nutzer erreicht, muss den Namen sichtbar nennen. Für Eigenbetrieb und Forschung greift beides nicht.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
DeepSeek beschreibt am 22.01.2025 ein Modell mit offenen Gewichten, das Zwischenschritte über Reinforcement Learning erwirbt. Damit ist der zweite Skalierungspfad, mehr Rechenzeit zur Antwortzeit, nicht mehr auf geschlossene Anbieter beschränkt.
Originalarbeiterreichbar
LLaMA: Open and Efficient Foundation Language Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Touvron und Mitautoren stellen am 27.02.2023 eine Modellreihe vor, deren Gewichte an Forschende herausgegeben werden. Damit beginnt der offene Branch: Von hier an gibt es zu jedem geschlossenen Modell eine Alternative, die man selbst betreiben kann.