GrundlagenGrundkursKapitel 10von 16 im Pfad
Welches Modell, welche Stufe
Kapitel 09 zeigt, wie ein Modell etwas anstellt, was es selbst nicht kann. Danach kommt die Frage, die jeder stellt, der über die Voreinstellung hinausgeht: Womit arbeite ich eigentlich, und ist das das richtige.
Der Versuch, die Frage abzuschaffen
Am 7. August 2025 hat OpenAI sie abgeschafft. Mit GPT-5 verschwand die Modellauswahl aus ChatGPT, und an ihre Stelle trat ein einziges umschaltendes System (externe Seite, help.openai.com), das selbst entscheiden sollte, welche Frage welches Modell bekommt.
Fünf Tage später stand die Auswahl wieder da:
4o is back in the model picker for all paid users by default (externe Seite, help.openai.com)
Am 11. Dezember 2025 fiel auch die zweite Automatik, die Umschaltung auf das nachdenkende Modell. Der Eintrag sagt im ersten Satz, für wen:
Gut drei Monate später stand sie wieder da, diesmal als Einstellung, die man ausmachen kann:
Turn automatic switching between Instant and Thinking on or off (externe Seite, help.openai.com)
Sieben Monate, vier Änderungen an derselben Frage, beim Anbieter mit den meisten Nutzern. Einen Sieger hat das nicht hervorgebracht. Am Ende stehen die Stufen sichtbar im Wähler und ein Schalter daneben, und genau das ist der beste verfügbare Beleg dafür, dass diese Wahl bei Ihnen bleibt.
Drei Stufen, grob gesagt
Die Anbieter führen ihre Modelle in Stufen, von der billigen und schnellen bis zur teuersten. Wie viele es sind und wie sie heißen, geht auseinander, und warum sich daraus keine gemeinsame Tabelle bauen lässt, steht in Tiefe 2. Für den Anfang genügen drei. Anthropic schreibt die Zuordnung selbst hin:
Klein heißt schnell und billig, und es reicht für alles, was hauptsächlich Umformung ist, etwa zusammenfassen oder ein Feld aus einem Text herausziehen. Welche Formen von Aufgaben es überhaupt gibt, steht in Kapitel 15.
Mittel ist der Arbeitsplatz für den Alltag, und die Anbieter empfehlen ihn für den Regelfall.
Groß lohnt sich, wo eine Aufgabe über mehrere Schritte geht und ein Fehler am Anfang alles danach verdirbt.
Was die Anbieter dabei offenlassen, ist die Größe im Wortsinn. Wie viele Gewichte in einem dieser Modelle stecken, veröffentlicht keiner von ihnen; die Stufen sind Preis- und Leistungsklassen. Bei den offenen Modellen steht die Zahl im Namen, dazu Beurteilen und Einordnen, Kapitel 01 und KI-Wissen, Kapitel 10.
Die Faustregel dazu ist unspektakulär und reicht weit: Fangen Sie in der Mitte an. Nach oben gehen Sie, wenn das Ergebnis nicht taugt, nach unten, wenn es immer taugt.
Der zweite Regler
Neben der Stufe gibt es seit 2024 eine zweite Stellschraube. Ein Modell kann
vor der Antwort Zwischenschritte erzeugen, also gewissermaßen nachdenken, und
wie lange es das tut, lässt sich einstellen. Bei Claude Opus 5 reicht der
Regler von low bis max, bei den anderen Anbietern heißt er anders und
steuert dieselbe Sache. Bei seiner Einführung
verschob er eine Entscheidung, die bis
dahin bei der Modellwahl lag: Wer sparen wollte, nahm vorher ein kleineres
Modell und dreht heute die Stufe herunter.
seitlich verschiebbar
eigene Darstellung, Stand 07.08.2026
Wichtig daran ist, dass beide Regler auf dasselbe Ergebnis wirken. Ein mittleres Modell mit viel Denkzeit kann ein großes mit wenig schlagen, und umgekehrt. Wer die Stufe hochdreht und die Denkzeit vergisst, hat nur die Hälfte probiert. Dieselbe Wirkung heißt trotzdem noch keine Austauschbarkeit: Was mehr Denkzeit kostet und ab wann sie aufhört zu helfen, steht in Tiefe 3.
Was der Abstand ausmacht
Zwischen der kleinsten und der größten Stufe desselben Anbieters liegt beim Preis der Faktor 8 bis 25, je nachdem, wen Sie fragen; die drei Zahlen stehen in Tiefe 2. Das ist mehr, als die meisten schätzen, und es ist der Grund, warum sich die Frage überhaupt lohnt: Wer eine Aufgabe, die millionenfach anfällt, eine Stufe tiefer erledigen kann, spart nicht ein paar Prozent.
Umgekehrt ist bei einer Handvoll Anfragen am Tag jede Sparüberlegung verlorene Zeit. Dann entscheidet allein, was die Aufgabe braucht, und der Preis fällt aus der Rechnung. Die Reihenfolge bleibt dieselbe: erst die Aufgabe.
Woran Sie die Wahl festmachen
Drei Fragen genügen für den Anfang, und keine davon handelt vom Modell:
Wie oft läuft das? Einmal am Tag oder tausendmal in der Stunde. Nur im zweiten Fall lohnt das Nachrechnen.
Was passiert bei einem Fehler? Fällt er sofort auf, oder steht er anschließend in einem Bericht, den jemand für geprüft hält.
Hängt etwas daran? Eine Aufgabe mit zehn aufeinander aufbauenden Schritten verzeiht wenig, weil sich Fehler dabei fortpflanzen. Das steht ausführlicher in Kapitel 09.
Die naheliegende Darstellung wäre eine Tabelle mit drei Spalten: klein, mittel, groß. Sie hält der Wirklichkeit seit etwa einem Jahr nicht mehr stand.
Drei Anbieter, drei Ordnungen
Anthropic führt fünf Stufen, eine davon mit eingeschränkter Verfügbarkeit. OpenAI führt drei. Google führt drei Familien, verteilt über vier Generationen, die gleichzeitig im Preisverzeichnis stehen. Wer das in ein gemeinsames Schema presst, erzeugt eine Ordnung, die die Anbieter selbst nicht behaupten.
Was sich vergleichen lässt, ist der Abstand innerhalb eines Anbieters:
| Anbieter | kleinste Stufe | größte Stufe | Faktor |
|---|---|---|---|
| Anthropic | Haiku 4.5, 1 und 5 | Fable 5, 10 und 50 | 10 |
| OpenAI | gpt-5.6-luna, 0,20 und 1,20 | gpt-5.6-sol, 5 und 30 | 25 |
| Gemini 3.1 Flash-Lite, 0,25 und 1,50 | Gemini 3.1 Pro Preview, 2 und 12 | 8 |
USD je Million Token, Eingabe und Ausgabe, abgerufen am 07.08.2026 bei Anthropic (externe Seite, platform.claude.com), OpenAI (externe Seite, developers.openai.com) und Google (externe Seite, ai.google.dev). Bei Google ist die größte Stufe als Vorschau gekennzeichnet, es gibt dort gerade keine allgemein verfügbare Spitze derselben Generation.
Ein Satz wie „die große Stufe kostet etwa zehnmal so viel“ wäre also bei genau einem der drei richtig.
Die höhere Nummer ist nicht die teurere
Bei Google steht die Versionsnummer nicht für eine Rangfolge. Gemini 3.5 Flash verlangt für die Ausgabe 9 USD je Million Token, Gemini 3.6 Flash 7,50. In der Flash-Lite-Reihe läuft es andersherum: 3.1 kostet 0,25 und 1,50, das höher nummerierte 3.5 kostet 0,30 und 2,50.
Praktisch heißt das, dass ein Wechsel auf die höhere Nummer eine eigene Messung verlangt. Bei Anthropic und OpenAI ist die aktuelle Generation eine geschlossene Reihe, dort stimmt die Vermutung eher.
Die Ausgabe ist die teure Spalte
Bei den Textmodellen der aktuellen Generation kostet ein Ausgabe-Token das Fünf- bis Sechsfache eines Eingabe-Tokens, und zwar bei allen dreien. Das ist die Zahl, die beim ersten Blick auf eine Rechnung fehlt: Ein Auftrag, der 50.000 Token Zusammenhang mitschickt und 2.000 Token Antwort erzeugt, hat einen kleineren Anteil bei der Eingabe, als das Verhältnis der Textmengen vermuten lässt.
Die Spanne gilt für diese eine Gruppe. Gemini 3.5 Flash-Lite verlangt mit 0,30 und 2,50 gut das Achtfache, und ein Sprachmodell wie gpt-realtime-2.1 rechnet für Audio mit 32 und 64, also zwei zu eins. Wer eine solche Faustzahl benutzt, prüft sie an der Zeile, um die es geht.
Bei Audio kommt zu dieser Spalte eine zweite Größe, die es bei Text nicht gibt: Ton wird nach Dauer in Token umgerechnet, und zwar mit zwei verschiedenen Raten. Was daraus für ein Gespräch folgt, steht in Conversational AI, Kapitel 11.
Dazu kommt ein Posten, den man nicht sieht. Wenn ein Modell vor der Antwort nachdenkt, sind diese Zwischenschritte Ausgabe-Token und werden auch so abgerechnet. Die Dokumentation nennt dafür ein eigenes Feld in der Antwort,
und beantwortet damit die Frage, warum eine kurze Antwort teuer sein kann. Was Sie lesen, ist manchmal ein Bruchteil dessen, was erzeugt und bezahlt wurde.
seitlich verschiebbar
eigene Darstellung, Stand 04.08.2026
Der Listenpreis ist selten der bezahlte
Zwischen der Zahl im Verzeichnis und der Zahl auf der Rechnung liegen Modifikatoren, und sie gehen in beide Richtungen.
Nach unten. Der Stapelbetrieb halbiert bei allen drei Anbietern, wenn eine Antwort nicht sofort gebraucht wird. Ein Cache für wiederkehrende Textteile kostet beim Schreiben mehr und beim Lesen ein Zehntel des Eingabepreises. Ab wann er sich rechnet, hängt daran, wie lange er halten soll, und die Dokumentation rechnet es vor:
Bei Google kommt ein dritter Posten dazu, ein Preis je Stunde für das, was dort liegt. Dort zahlt man also auch fürs Warten. Was der Cache beim Durchsatz ausmacht, steht in Kapitel 11.
Nach oben. Wer bei Anthropic verlangt, dass die Verarbeitung in einer bestimmten Weltregion stattfindet, zahlt 10 Prozent Aufschlag. Ein Betriebsmodus mit schnellerer Ausgabe verdoppelt den Preis. Bei Google kostet der Vorrangbetrieb bei Gemini 3.1 Pro Preview 3,60 und 21,60 statt 2 und 12.
Zwischen der billigsten und der teuersten Bedienung desselben Google-Modells liegt damit der Faktor 3,6, ohne dass das Modell gewechselt hätte.
Ein Verfallsdatum, das nicht griff
Preistabellen veralten, und manchmal steht das Verfallsdatum sogar dabei. Claude Sonnet 5 wurde zu einem Einführungspreis eingeführt:
Die angekündigte Erhöhung ist ausgeblieben. Anthropic hat den Einführungspreis zum Regelpreis erklärt:
Wer am 07.08.2026 mit dem höheren Preis ab September gerechnet hat, lag bei der Zahl falsch, nicht bei der Vorsicht: Wer eine Preisangabe irgendwo liest, sucht weiterhin nach dem Erhebungsdatum, bevor er damit rechnet. Ein Datum in der Preistabelle sagt nichts darüber, in welche Richtung sich der Preis danach bewegt.
Was daraus für die Wahl folgt
Drei Punkte, die sich aus dem Obigen ergeben und die man messen kann, statt sie zu schätzen:
Rechnen Sie mit Ihrem eigenen Verhältnis. Eine Aufgabe mit viel Zusammenhang und kurzer Antwort verhält sich völlig anders als eine, die lange Texte erzeugt. Der Preisvergleich zweier Modelle fällt je nach Aufgabe verschieden aus.
Prüfen Sie die Stufe darunter, bevor Sie die darüber nehmen. Der Faktor zwischen zwei Stufen ist groß genug, dass sich ein Versuch immer lohnt. Was beim Wechsel am Text zu tun ist, steht in Kapitel 06.
Der Reasoning Effort ist Teil der Rechnung. Ein mittleres Modell mit hohem Reasoning Effort kann teurer sein als ein großes mit niedrigem, und das steht in keiner Preistabelle.
Ein Preis je Million Token setzt voraus, dass ein Token bei beiden Modellen dasselbe ist. Diese Voraussetzung gilt seit 2026 nicht mehr, und der Unterschied ist groß genug, um jede Kalkulation zu kippen.
Derselbe Text, verschiedene Token
Anthropic hat mit Claude 4.7 den Tokenizer gewechselt. In der Preisdokumentation steht dazu ein Satz, der leicht zu überlesen ist:
Was ein Token ist und warum die Zerlegung überhaupt variiert, steht in Kapitel 03. Für die Kalkulation heißt es: Der Preis je Token vergleicht über diese Grenze hinweg zwei verschiedene Größen.
Rechnen Sie es an einem konkreten Paar durch. Claude Sonnet 4.6 kostet 3 und 15 USD je Million Token und rechnet mit dem alten Tokenizer, Claude Opus 5 kostet 5 und 25 und rechnet mit dem neuen. Die Preistabelle legt einen Aufpreis von 67 Prozent nahe. Für denselben Text liegt er bei gut 117 Prozent, weil dieselbe Textmenge rund 30 Prozent mehr Token ergibt.
Die Angabe steht ausdrücklich unter Vorbehalt, der genaue Zuwachs hängt vom Inhalt und von der Art der Arbeitslast ab (externe Seite, platform.claude.com). Wer es genau wissen will, misst mit eigenem Material. Die Größenordnung reicht aber, um die Fehlerrichtung zu kennen: Ein Vergleich über den Tokenizer-Wechsel hinweg fällt zugunsten des neueren Modells aus, und zwar zu Unrecht.
seitlich verschiebbar
eigene Darstellung, Stand 04.08.2026
Wo die Länge den Preis ändert, und wo nicht
Beim Umgang mit langen Eingaben gehen die Anbieter auseinander, und das ist eine Entscheidung mit Folgen für den Aufbau.
Google und OpenAI staffeln nach Prompt-Größe, mit derselben Bauform und verschiedenen Schwellen. Gemini 3.1 Pro Preview kostet bis 200.000 Token 2 und 12 USD, darüber 4 und 18. Bei OpenAI führt die Preistabelle jede Stufe zweimal, für kurzen und für langen Zusammenhang: gpt-5.6-sol steht dort mit 5 und 30 gegen 10 und 45, gpt-5.6-luna mit 0,20 und 1,20 gegen 0,40 und 1,80. In beiden Fällen trifft der höhere Satz jeden Token dieser Anfrage, auch die ersten tausend.
Anthropic hat das für die neueren Modelle abgeschafft und schreibt es ausdrücklich hin:
Praktische Folge: Wer bei den ersten beiden nah an der Schwelle arbeitet, hat einen Grund, den Zusammenhang zu kürzen, der nichts mit Qualität zu tun hat. Wie teuer es wird, hängt am eigenen Verhältnis, denn die Eingabe steigt stärker als die Ausgabe. Ein Aufbau, der gelegentlich 210.000 Token an Gemini 3.1 Pro schickt, zahlt dafür an der Eingabe das Doppelte und an der Ausgabe die Hälfte mehr.
Das Budget ist ein Ziel
Der Denkregler wird oft für eine Obergrenze gehalten. Die Dokumentation sagt etwas anderes:
The budget is a target rather than a strict cap. (externe Seite, platform.claude.com)
Das Modell hört gegebenenfalls früher auf, und die harte Grenze ist weiterhin die Höchstzahl der Ausgabe-Token. Für die Kostenplanung heißt das, dass ein gesetztes Budget die obere Schranke nur ungefähr beschreibt.
Der zweite Satz dazu ist der wichtigere, weil er gegen den Reflex arbeitet, das Budget bei schlechten Ergebnissen einfach hochzudrehen:
Abnehmender Ertrag bei steigender Wartezeit, und wo genau der Ertrag abknickt, hängt an der Aufgabe. Das ist eine Einladung zum Messen und eine Warnung vor der Voreinstellung „mehr hilft mehr“.
Zwei Automatiken, und was von Hand blieb
Zwei Versuche, dem Anwender eine Entscheidung abzunehmen, sind fast gleichzeitig unternommen worden. Beide stehen heute da, und in beiden Fällen ist etwas von Hand daneben geblieben.
Die Wahl des Modells ging über vier Änderungen und liegt seit März 2026 bei einem Schalter, den man ausmachen kann. Die Geschichte dazu steht in Tiefe 1.
Bei der Wahl des Reasoning Effort hat der Handregler die Bauform gewechselt. Was verschwindet, ist die Zahl: Bei Claude 4.7 und späteren Modellen beantwortet die Schnittstelle ein von Hand gesetztes Denkbudget mit einem Fehler. An ihre Stelle tritt eine Stufe, die ebenfalls von Hand gesetzt wird, und innerhalb dieser Stufe entscheidet das Modell:
Dieselbe Dokumentation sagt auch, wofür die Zahl weiterhin taugt, solange ein Modell sie annimmt:
Das ist dieselbe Bewegung, die Kapitel 12 an den Reglern für die Wortwahl beschreibt: von einer Zahl, die ein Mensch setzt, zu einer benannten Stufe, innerhalb derer das Modell selbst entscheidet. Für die Kalkulation heißt es, dass die obere Schranke gröber wird.
Der Unterschied zwischen den beiden Automatiken liegt darin, was man hinterher sieht. Über den Reasoning Effort entscheidet das Modell innerhalb einer laufenden Anfrage und sieht das Ergebnis selbst. Die Modellwahl trifft man vorher, und wer sie falsch trifft, merkt es an einer Antwort, die er mit nichts vergleichen kann. Deshalb steht im nächsten Abschnitt eine Messung.
Wer den Maßstab stellt, gewinnt
Ein eigener Messlauf zeigt, wie leicht ein Modellvergleich zugunsten des Falschen ausgeht. Getestet wurden am 19.04.2026 sieben lokale Modelle in derselben Quantisierung an 25 kurzen Diktat-Aufnahmen, je fünf Wiederholungen, zusammen 875 Anfragen auf einem MacBook Pro M4 Max. Gemessen wurde die Wortfehlerrate gegen einen Referenztext, dazu die Latenz.
Auf den zehn Aufnahmen, deren Referenztext von Hand geschrieben wurde, liegt das kleinere Modell vorn: Qwen3-4B kommt auf eine Wortfehlerrate von 0,121 bei einem Median von 262 Millisekunden, Qwen 2.5 7B auf 0,162 bei 491 Millisekunden. Besser und in der Hälfte der Zeit, bei halber Dateigröße.
Über alle 25 Aufnahmen dreht sich das Ergebnis um, 0,065 gegen 0,084, und der Grund steht im Aufbau: Bei 15 der 25 stammte der Referenztext vom 7B-Modell selbst. Dort maß der Lauf, wie ähnlich das Modell seiner eigenen früheren Ausgabe ist. Der Aufbau hatte das vorhergesehen und die zehn Aufnahmen mit dem geschriebenen Referenztext getrennt ausgewertet. Ohne diese zweite Auswertung stünde in der Tabelle das größere Modell vorn.
Das ist der Teil, der über den Einzelfall hinaus gilt. Wer zwei Modelle vergleicht, misst gegen eine Erwartung, und die kommt irgendwoher. Stammt sie von einem der Beteiligten, ist die Messung entschieden, bevor sie beginnt. Dieselbe Frage stellt sich bei jeder veröffentlichten Bestenliste: Wer hat den Referenztext geschrieben, und wer hat die Aufgaben ausgesucht.
Was aus diesem Lauf folgte, steht im Werkstattbericht zur eigenen Diktier-App: dieselben sieben Modelle, dort mit einer Qualitätszahl statt der Wortfehlerrate, dazu die beiden, die erst später einzeln nachgemessen wurden und heute im Programm stehen. Wie leicht der Vorbehalt von oben beim Aufschreiben verlorengeht, zeigt derselbe Bericht auch: Er hat die getrennte Auswertung vier Monate lang nicht erwähnt.
Was ein belastbarer Vergleich braucht
Aus den beiden Abschnitten davor ergibt sich eine kurze Liste. Sie ist unbequem, weil sie Arbeit bedeutet, und sie ist der einzige Weg zu einer belastbaren Zahl.
- Eigenes Material. Zwanzig echte Fälle aus dem eigenen Betrieb schlagen jede fremde Bestenliste, weil die Verteilung stimmt.
- Ein Maßstab von außen. Der Referenztext stammt von einem Menschen oder aus einer Quelle, die an der Messung nicht beteiligt ist.
- Mehrere Läufe je Fall. Ein einzelner Durchlauf misst auch die Zufälligkeit der Erzeugung mit.
- Kosten und Wartezeit im selben Lauf. Beide gehören zur Antwort auf die Frage, welches Modell passt, und beide fallen weg, wenn man nur die Qualität notiert.
Quellen
6 Einträgealle erreichbar
Erreichbarkeit automatisch geprüft
Dokumentationerreichbar
ChatGPT Release Notes (externe Seite, help.openai.com)
help.openai.comgeprüft 24.09.2026
Die fortlaufenden Änderungshinweise zu ChatGPT. Sie führen die Automatik und ihre Rücknahmen in derselben Liste: am 07.08.2025 ein einziges umschaltendes System, fünf Tage später der Modellwähler zurück für zahlende Kunden, am 11.12.2025 das Ende des automatischen Umschaltens auf das nachdenkende Modell für die kostenlosen Zugänge und die Go-Stufe, am 17.03.2026 dieselbe Automatik zurück als abschaltbare Einstellung. Am 10.06.2026 heißen die Stufen Instant, Medium, High und Extra High, der Schalter steht in den Einstellungen.
Dokumentationerreichbar
Anthropic, Pricing (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Anthropics Preisverzeichnis mit den Zahlen je Modell und den Aufschlägen daneben. Zwei Angaben darin wiegen für einen Vergleich schwerer als die Preise selbst: Die Modelle ab Claude 4.7 rechnen mit einem anderen Tokenizer, der für denselben Text rund 30 Prozent mehr Token erzeugt, und Claude Sonnet 5 steht bis zum 31.08.2026 zu einem Einführungspreis von 2 und 10 statt 3 und 15 USD je Million Token. Abgerufen am 07.08.2026: Haiku 4.5 zu 1 und 5, Sonnet 5 zu 2 und 10, Opus 5 zu 5 und 25, Fable 5 zu 10 und 50.
Dokumentationerreichbar
Anthropic, Pricing: Hinweis zum Sonnet-5-Einführungspreis (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Dieselbe Preisseite wie unter anthropic-preise, mit einem Hinweis, der dort nicht ergänzt werden kann: Die für Sonnet 5 zum 31.08.2026 angekündigte Erhöhung auf 3 und 15 statt 2 und 10 USD je Million Token entfällt, der Einführungspreis gilt dauerhaft weiter.
Dokumentationerreichbar
OpenAI, Pricing (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
OpenAIs Preisverzeichnis der Schnittstelle. Die Generation 5.6 führt drei Stufen, abgerufen am 07.08.2026: gpt-5.6-luna zu 0,20 und 1,20 USD je Million Token, gpt-5.6-terra zu 2 und 12, gpt-5.6-sol zu 5 und 30. Zwischen kleinster und größter Stufe liegt damit der Faktor 25, der größte der drei Anbieter. Jede Stufe steht zweimal in der Tabelle, für kurzen und für langen Zusammenhang: im langen kostet sol 10 und 45, terra 4 und 18, luna 0,40 und 1,80, also doppelte Eingabe bei anderthalbfacher Ausgabe. Der Stapelbetrieb halbiert, ein zwischengespeicherter Eingabe-Token kostet ein Zehntel und das Schreiben in den Cache das 1,25-fache. Das Verhältnis fünf bis sechs zwischen Ausgabe und Eingabe gilt für die Textmodelle; gpt-realtime-2.1 rechnet für Audio 32 und 64 USD, also zwei zu eins.
Dokumentationerreichbar
Google, Gemini API Pricing (externe Seite, ai.google.dev)
ai.google.devgeprüft 24.09.2026
Googles Preisverzeichnis für die Gemini-Schnittstelle. Es führt vier Generationen gleichzeitig und staffelt zusätzlich nach Kontextlänge und Dienstgüte. Abgerufen am 07.08.2026: Gemini 3.1 Flash-Lite zu 0,25 und 1,50 USD je Million Token, Gemini 3.5 Flash-Lite zu 0,30 und 2,50, Gemini 3.6 Flash zu 1,50 und 7,50, Gemini 3.1 Pro Preview zu 2 und 12 bis 200.000 Token und zu 4 und 18 darüber. Die höhere Nummer ist dabei nicht durchgängig die teurere: Gemini 3.5 Flash verlangt für die Ausgabe 9 USD, Gemini 3.6 Flash 7,50. Der Cache kostet hier zusätzlich nach Zeit, 1 USD je Million Token und Stunde bei den Flash-Modellen und 4,50 bei Pro. An der Ausgabespalte steht der Vermerk, dass Denk-Token darin enthalten sind.
Dokumentationerreichbar
Anthropic, Extended thinking (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Die Herstellerdokumentation zum Denkregler. Sie beantwortet drei Fragen, die man sonst raten müsste: Denk-Token werden als Ausgabe abgerechnet und sind in einem eigenen Feld der Antwort nachzählbar, das eingestellte Budget wirkt als Ziel und wird nicht garantiert eingehalten, und ein größeres Budget bringt abnehmenden Ertrag bei steigender Wartezeit. Dazu der Befund, dass der von Hand gesetzte Regler bei Claude 4.7 und später einen Fehler 400 auslöst und durch ein adaptives Verfahren ersetzt ist, das selbst entscheidet, ob überhaupt gedacht wird.