Eine Rangliste ohne Wert
2026 begannen Unternehmen, den Token-Verbrauch ihrer Beschäftigten zu ranken. Wie es dazu kam, warum dieselben Leute wenige Wochen später zurückruderten und was zwei Durchgänge einer randomisierten Studie über den Zusammenhang von Verbrauch und Wirkung sagen.
Im Frühjahr 2026 stand in einer firmeninternen Bestenliste eine Zahl: 281 Milliarden Token, verbraucht von einer einzigen Person, in dreißig Tagen. Zu Listenpreisen sind das mehr als eine Million Dollar. Die Liste hatte ein Mitarbeiter selbst gebaut, sie hieß Claudeonomics, sie führte die 250 stärksten Verbraucher unter mehr als 85.000 Beschäftigten, und weit oben bekam man einen Titel verliehen: „Token Legend“ (externe Seite, fortune.com).
Was diese 281 Milliarden über die Arbeit dieser Person aussagen, weiß niemand.
Wie der Verbrauch zum Ausweis wurde
Die Sätze dazu kamen von ganz oben, und sie waren öffentlich. Auf einem Technikgipfel in San Francisco erzählte der Technikchef von Meta im Februar 2026, sein bester Ingenieur verbrauche sein Jahresgehalt in Token und sei dafür „5x to 10x more productive“ (externe Seite, forbes.com). Sein Kommentar dazu: „This is easy money.“ Und: „No limit.“
Einen Monat später sagte der Chef von Nvidia in einem Podcast (externe Seite, x.com), er wäre zutiefst beunruhigt, wenn ein Ingenieur mit 500.000 Dollar Gehalt nicht wenigstens 250.000 Dollar in Token verbrauche. Der Chef von Databricks ließ die Entwicklungsabteilung für einen Kollegen klatschen, der in zwei Wochen über 7.000 Dollar verbraucht hatte. Ein Gründer schrieb bei LinkedIn, er glaube inzwischen, „the winners in any category will be the ones who spend the most tokens“ (externe Seite, forbes.com).
Aus solchen Sätzen entsteht sehr schnell eine Rangliste. Sie sind ja bequem: Der Verbrauch steht in der Abrechnung, er lässt sich täglich abrufen, er braucht kein Urteil und keine Rückfrage. Damit hat er alles, was eine Kennzahl attraktiv macht, außer einem Bezug zur Sache.
Das Muster ist nicht auf Konzerne beschränkt
Wer denkt, so etwas passiere nur hinter Firmentüren, findet die gleiche Bauform frei im Netz. Es gibt Werkzeuge, die den eigenen Verbrauch aus den Arbeitsverzeichnissen der Programmierassistenten auslesen und ins Netz stellen. Eines beschreibt sich selbst als Zähler, mit dem man sich mit Freunden misst (externe Seite, github.com), und stellt in Aussicht, wer von ihnen als erster eine Billion Token zusammenhabe. Ein anderes führt eine öffentliche Rangliste mit öffentlichen Profilen (externe Seite, github.com). Der Wettbewerb ist dort der Zweck.
Das ist der Kern von Tokenmaxxing, und darin steckt bereits der Fehler: Die Endung stammt aus dem Netzjargon und bedeutet, eine einzelne Eigenschaft bis zum Anschlag zu treiben, ohne Rücksicht darauf, wofür sie steht.
Der Rückzug kam schnell
Die Bestenliste bei Meta verschwand zwei Tage, nachdem sie öffentlich bekannt geworden war. Ihr Erbauer nahm sie selbst herunter, mit der Begründung, Daten daraus seien nach außen gelangt. Der Text, den die Beschäftigten danach vorfanden, endete mit dem Satz, man habe „made the decision to shutter Claudeonomics for now“ (externe Seite, fortune.com).
Wenige Wochen später schrieb derselbe Technikchef, der im Februar „easy money“ gesagt hatte, ein Rundschreiben an die Belegschaft. Niemand solle KI-Werkzeuge benutzen, nur um sie benutzt zu haben, und: „token usage alone is not a measure of impact of any kind“ (externe Seite, the-decoder.com). Ab 2027 soll es Budgets je Bereich geben, ein zentrales Dashboard und automatische Warnungen bei auffälligen Kostensprüngen. Der Anlass steht in derselben Meldung: In gut dreißig Tagen waren 73,7 Billionen Token zusammengekommen, die Ausgaben für den internen Gebrauch bewegten sich auf einen Milliardenbetrag zu.
Vier Monate zwischen „kein Limit“ und „kein Maß für Wirkung“. Das ist schnell für eine Kennzahl, die vorher nirgends geprüft wurde.
Warum es nicht funktionieren konnte
Es gibt eine Messung dazu, und sie ist älter als die Debatte. Im Juli 2025 veröffentlichte METR einen randomisierten Versuch (externe Seite, arxiv.org): 16 erfahrene Entwickler, 246 echte Aufgaben aus Projekten, an denen sie im Schnitt seit fünf Jahren arbeiteten. Die eine Hälfte der Aufgaben durften sie mit KI-Werkzeugen bearbeiten, die andere nicht.
Vorher erwarteten sie, mit den Werkzeugen 24 Prozent schneller zu sein. Hinterher schätzten sie, sie seien 20 Prozent schneller gewesen. Gemessen brauchten sie 19 Prozent länger.
Diese drei Zahlen erledigen jede Rangliste des Verbrauchs, und zwar nicht, weil sie beweisen würden, dass die Werkzeuge nichts taugen. Sie beweisen etwas Unbequemeres: Die Beteiligten können ihre eigene Wirkung nicht einschätzen. Wer viel benutzt, fühlt sich schnell. Das Gefühl und die Uhr gehen dabei um fast vierzig Prozentpunkte auseinander.
Die zweite Messung, und warum sie nichts rettet
Die 19 Prozent sind ein Stand von 2025, und wer sie heute zitiert, sollte dazusagen, was aus ihnen geworden ist. METR hat ab August 2025 erneut gemessen, mit zehn Beteiligten aus der ersten Runde und 47 neu angeworbenen. Diesmal kam eine Beschleunigung heraus, 18 Prozent bei den Rückkehrern und 4 Prozent bei den Neuen. Vorzeichen gedreht, selber Personenkreis, ein Jahr später.
Trotzdem taugt auch diese Zahl nicht als Beleg, und das sagen die Autoren selbst:
Das Konfidenzintervall reicht von 38 Prozent schneller bis 9 Prozent langsamer und schließt die Null ein. Wichtiger ist der Grund, warum die Anordnung nicht mehr gilt. Der Versuch verlangt, dass ein Teil der Aufgaben ohne KI bearbeitet wird, und dazu waren zu wenige bereit:
Von denen, die mitmachten, reichten 30 bis 50 Prozent (externe Seite, metr.org) einzelne Aufgaben gar nicht erst ein, weil sie diese ohne KI nicht angehen wollten. Übrig bleibt eine Stichprobe ohne die Fälle, bei denen der Gewinn am größten gewesen wäre. Die Bezahlung war zudem von 150 auf 50 Dollar je Stunde gesenkt worden, was nach Einschätzung der Autoren dazu beitrug. METR baut den Versuch deshalb um.
Für die Rangliste ist dieser Befund unbequemer als jede Zahl aus beiden Durchgängen. Der saubere Vergleich, den eine Firma bräuchte, um die Wirkung ihrer Ausgaben zu belegen, ist praktisch nicht mehr herstellbar, weil die Vergleichsbedingung niemand mehr freiwillig herstellt. Wer trotzdem eine Rangfolge aufstellt, misst weiterhin den Verbrauch. Was der über die Wirkung sagt, ist seit dem ersten Durchgang unverändert.
Dazu kommt eine schlichtere Eigenschaft. Verbrauch ist eine Eingangsgröße, kein Ergebnis. Er lässt sich beliebig erzeugen, notfalls über Nacht, ohne dass ein Mensch dabei ist. Eine Zahl, die leicht zu erheben und noch leichter zu erhöhen ist, taugt nicht als Maßstab. Sie wird zum Ziel, sobald sie zum Maßstab erklärt wird, und hört genau in diesem Moment auf, etwas zu messen.
Der Fehler ist älter als die Sache
In der Softwareentwicklung gibt es diesen Fehler seit Jahrzehnten. Man hat Zeilen Code gezählt, weil Zeilen zählbar sind. Man hat behobene Fehler gezählt, bis Fehler entstanden, die sich gut beheben ließen. Die Reaktion der Technikverantwortlichen (externe Seite, leaddev.com) auf die Token-Ranglisten fiel entsprechend aus: Eine ehemalige Entwicklungsverantwortliche berichtete, sie habe ihre Erhebung nach der Einführungsphase wieder abgeschafft, weil sie „did nothing to measure developer productivity“ (externe Seite, leaddev.com). Ein anderer nannte es einen Rückfall in die Zeit vor DORA (der Forschungsgruppe, die die heute gebräuchlichen Kennzahlen für Software-Auslieferung geprägt hat), in die Ära des „measuring lines of code“ (externe Seite, leaddev.com).
Neu ist nur der Preis. Zeilen zu zählen war kostenlos. Diese Kennzahl kostet pro erhobener Einheit Geld, und zwar in einer Größenordnung, die in der Quartalsplanung auffällt.
Was daran ernst gemeint war
Es lohnt sich, den Gedanken freizulegen, aus dem die Übertreibung entstand, denn er ist richtig. Wer ein Werkzeug nur nebenbei benutzt, lernt seine Grenzen nicht kennen. Wer eine Woche lang ernsthaft damit arbeitet, weiß danach, wo es taugt und wo es Unsinn produziert, und diese Erfahrung ist mit Lesen nicht zu ersetzen. In den Anfangsmonaten einer neuen Technik ist ein Anschub deshalb vernünftig, und eine Anzeige des eigenen Verbrauchs ist ein legitimes Werkzeug dafür.
Der Bruch liegt zwischen Anschub und Rangfolge. Eine Anzeige sagt: Schau es dir an. Eine Rangliste sagt: Du bist Platz 43. Das erste ist eine Einladung, das zweite ist eine Aussage über eine Person, und für diese Aussage gibt es keine Grundlage.
Wer wissen will, ob KI-Werkzeuge in einem Betrieb etwas bringen, muss das Ergebnis messen, und das ist unbequem: Es dauert länger, es braucht einen Vergleich, und manchmal kommt heraus, was man nicht hören wollte. Genau deshalb ist der Verbrauch so beliebt geworden.
Was dieser Text nicht belegt
Die Sätze der Firmenchefs sind öffentlich gefallen, auf Konferenzen, in einem Podcast, bei LinkedIn. Die Studie ist frei nachlesbar, die Werkzeuge auch.
Alles, was in den Unternehmen selbst geschah, ist es nicht. Die Bestenliste, ihre Titel, die Zahl 281 Milliarden, das Rundschreiben und die geplanten Budgets stehen in internen Unterlagen, die kein Unternehmen veröffentlicht hat. Nachlesen lässt sich davon nur die Berichterstattung. Diese Quellen sind deshalb unten als Bericht gekennzeichnet, und sie sind der Grund, warum dieser Text eine Meinung ist. Zur Untersuchung würde er erst mit den Unterlagen selbst.
Sollte sich einer dieser Punkte als falsch erweisen, ändert das an der Sache wenig. Die beiden Durchgänge der randomisierten Studie sind der eigentliche Einwand, und der zweite wiegt schwerer als der erste.
Quellen
9 Einträge8 erreichbar · 1 abgeschaltet
Erreichbarkeit automatisch geprüft
Bericht über nicht öffentliche Unterlagenabgeschaltet
The 'AI Gods' Spending As Much As They Can On AI Tokens (externe Seite, forbes.com)
forbes.comgeprüft 01.09.2026
Bestandsaufnahme vom 31.03.2026 mit den Aussagen mehrerer Unternehmensleitungen zum Token-Verbrauch ihrer Beschäftigten. Die Zitate sind öffentlich gefallen, auf Konferenzen und bei LinkedIn; die Zusammenstellung ist Berichterstattung.
Originalarbeiterreichbar
Jensen Huang im All-In-Podcast über Token-Budgets je Ingenieur (externe Seite, x.com)
x.comgeprüft 24.09.2026
Der Podcast veröffentlicht die Aussage des Nvidia-Chefs, ein Ingenieur mit 500.000 Dollar Gehalt solle mindestens 250.000 Dollar in Token verbrauchen, sonst sei er beunruhigt. Aufgenommen am letzten Tag der GTC 2026. Ohne Zitatprüfung, weil die Seite ihren Text erst im Browser nachlädt.
Bericht über nicht öffentliche Unterlagenerreichbar
Meta schaltet die Token-Rangliste seiner Beschäftigten ab (externe Seite, fortune.com)
fortune.comgeprüft 24.09.2026
Bericht vom 09.04.2026 über das firmeninterne Dashboard Claudeonomics, seine Titel und Zahlen und seine Abschaltung zwei Tage nach dem Bekanntwerden. Beruht auf firmeninternen Unterlagen, die Meta nicht veröffentlicht hat.
Bericht über nicht öffentliche Unterlagenerreichbar
Meta wechselt vom Anhäufen zum Verwalten der Token (externe Seite, the-decoder.com)
the-decoder.comgeprüft 24.09.2026
Bericht vom 13.06.2026 über das Rundschreiben des Meta-Technikchefs und die geplanten Token-Budgets ab 2027. Gibt eine Meldung von The Information wieder, deren Grundlage ein internes Schreiben ist.
Bericht über nicht öffentliche Unterlagenerreichbar
Tokenmaxxing and the search for AI metrics that matter (externe Seite, leaddev.com)
leaddev.comgeprüft 24.09.2026
Umfrage unter Technikverantwortlichen vom 27.04.2026 dazu, was sie von Token-Ranglisten halten und was sie stattdessen messen. Die Aussagen stammen aus Gesprächen für diesen Artikel, nachlesen lassen sie sich nur dort.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Randomisierter Versuch von METR mit 16 erfahrenen Entwicklern und 246 Aufgaben aus deren eigenen Projekten. Die Arbeit, die den Abstand zwischen Selbsteinschätzung und Messung beziffert: Die Beteiligten hielten sich für schneller und brauchten länger.
Originalarbeiterreichbar
METR, We are Changing our Developer Productivity Experiment Design (externe Seite, metr.org)
metr.orggeprüft 24.09.2026
Der Nachtrag zur vielzitierten Verlangsamungsstudie. METR hat ab August 2025 erneut gemessen, bekam ein umgekehrtes Vorzeichen und erklärt die eigenen Daten für unzuverlässig. Der Grund ist selbst ein Befund über die Verbreitung: Zu viele Beteiligte wollten die Vergleichsaufgaben ohne KI gar nicht mehr bearbeiten, auch für Bezahlung. Wer die Zahl von 19 Prozent aus der ersten Arbeit zitiert, sollte diesen Stand mitzitieren.
Werkzeugerreichbar
tokenlytics, Token-Zähler mit Wettbewerb (externe Seite, github.com)
github.comgeprüft 24.09.2026
Werkzeug, das den eigenen Token-Verbrauch aus den Verzeichnissen von Claude Code und Codex ausliest und mit anderen vergleichbar macht. Beleg für den Begriff und für die Form, in der er auftritt: als Wettbewerb, nicht als Kostenrechnung.
Werkzeugerreichbar
Tokscale, weltweite Rangliste des Token-Verbrauchs (externe Seite, github.com)
github.comgeprüft 24.09.2026
Kommandozeilenwerkzeug, das den Verbrauch mehrerer Programmierassistenten zusammenzählt und in eine öffentliche Rangliste stellt. Beleg dafür, dass der Vergleich nicht in der Firma bleibt.