Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 13von 16 im Pfad

Was ein Modell auf einem Bild erkennt

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Wer ein Foto in ein Chatfenster zieht, hat etwas anderes getan, als eine Datei anzuhängen. Das Bild geht als Bild an das Modell. Dort wird es zu Token, so wie Text zu Token wird (Kapitel 03), und gezählt wird dabei die Fläche.

Ein Bild kostet Fläche

Anthropic schreibt die Regel als einziger der drei großen Anbieter aus:

Claude views images in patches instead of pixels. Each patch is a 28×28-pixel block of the image, referred to as a visual token. (externe Seite, platform.claude.com)

Über das Bild wird also ein Raster gelegt, und jedes Feld darin zählt wie ein Token. Ein Feld ist 28 Bildpunkte breit und 28 hoch.

Der Rest ist Rechnen. Ein quadratisches Bild von 1000 mal 1000 Bildpunkten ergibt 36 Felder in der Breite, denn 1000 geteilt durch 28 sind 35,7, und ein angefangenes Feld zählt ganz. In der Höhe ebenso viele. 36 mal 36 sind 1296 sichtbare Token, und genau diese Zahl steht in der Beispieltabelle des Herstellers.

Nach der Faustzahl aus Kapitel 03, ein Token je vier Zeichen englischen Fließtexts, sind das gut fünftausend Zeichen. Ein Bildschirmfoto ist damit keine Beigabe zur Frage. Es ist der größere Teil davon.

Ein PDF ist ein Stapel Bilder

Die Folge daraus fällt den meisten erst an der Rechnung auf. Ein PDF wirkt wie eine Textdatei, und für ein Sprachmodell ist es keine. Die Dokumentation nennt den Grund in einem Nebensatz, in dem es eigentlich um etwas anderes geht:

because each page is processed as an image (externe Seite, platform.claude.com)

Jede Seite wird also gerastert und nach Fläche abgerechnet, ob dort nun ein Diagramm steht oder ein einzelner Satz. Das ist zugleich der Grund, warum es überhaupt funktioniert: Das Modell sieht die Tabelle, die Unterschrift und den Stempel, statt nur den Text, den ein Auslesewerkzeug herausgezogen hätte.

You can ask Claude about any text, pictures, charts, and tables in PDFs you provide. (externe Seite, platform.claude.com)

Für die Planung heißt das: Der Platz wird knapp, bevor die Seitenzahl es tut.

Dense PDFs (many small-font pages, complex tables, or heavy graphics) can fill the context window before reaching the page limit. (externe Seite, platform.claude.com)

Was man vorher wissen sollte

Die Herstellerdokumentation führt einen eigenen Abschnitt mit Grenzen. Drei davon betreffen den Alltag sofort.

Personen werden nicht benannt. Das Modell cannot be used to name people in images and refuses to do so (externe Seite, platform.claude.com). Die Grenze steht in den Nutzungsbedingungen des Anbieters. Sie ist damit eine Festlegung, die er jederzeit ändern könnte.

Gezählt wird ungefähr. Wer Objekte in einem Bild zählen lässt, bekommt eine Schätzung. Verfahren, die stattdessen messen, stehen in KI-Wissen, Kapitel 05:

Claude can give approximate counts of objects in an image but might not always be precisely accurate, especially with large numbers of small objects. (externe Seite, platform.claude.com)

Ob ein Bild von einer Maschine stammt, sieht das Modell nicht. Diese Grenze ist die überraschendste, weil man das Gegenteil erwartet:

Claude cannot determine whether an image is AI-generated and might be incorrect if asked. (externe Seite, platform.claude.com)

Wie ein solches Bild entsteht und woran es sich trotzdem erkennen lässt, steht in Kapitel 14.

Quellen

4 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    Vision (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Die Herstellerdokumentation zum Bild als Eingabe, und die einzige der drei, die ihre Abrechnung als Formel ausschreibt: Ein Bild wird in Blöcke von 28 mal 28 Pixeln zerlegt, und jeder Block ist ein sichtbares Token. Daraus folgt die Zahl über die Fläche, aufgerundet in beide Richtungen, gedeckelt bei 1568 sichtbaren Token für die ältere Stufe und 4784 für die neuere. Der Abschnitt Limitations zählt sieben Grenzen auf, darunter die für dieses Projekt wichtigste: Ob ein Bild von einer Maschine stammt, kann das Modell nicht sagen.

  • Dokumentationerreichbar

    PDF support (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Der Beleg dafür, dass ein PDF für ein Sprachmodell keine Textdatei ist. Die Seite nennt den Grund in einem Nebensatz: Jede Seite wird als Bild verarbeitet. Damit gilt für ein Dokument dieselbe Abrechnung nach Fläche wie für ein Foto, und die Obergrenze liegt bei 600 Seiten je Anfrage, bei 100 unterhalb eines Kontextfensters von einer Million Token.

  • Dokumentationerreichbar

    Image understanding (externe Seite, ai.google.dev)

    ai.google.devgeprüft 24.09.2026

    Googles Seite zum Bild als Eingabe, mit einer Abrechnung, die von der bei Anthropic abweicht: Ein kleines Bild kostet pauschal 258 Token, ein größeres wird in Kacheln zerlegt, und jede Kachel kostet wieder 258. Die Kachelgröße folgt der kürzeren Bildkante und ist damit vom Seitenverhältnis abhängig. Als Obergrenze nennt die Seite 3.600 Bilddateien je Anfrage.

  • Dokumentationerreichbar

    Images and vision (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die dritte Art, dieselbe Sache abzurechnen. Statt einer Formel gibt es hier eine Stufe, die der Aufrufende selbst wählt, und die Seite sagt zugleich den gemeinsamen Nenner aller drei Anbieter: Ein Bild wird wie Text in Token gemessen und wie Text bezahlt. Die Grenzenliste nennt dabei zwei, die bei Anthropic fehlen: nicht-lateinische Schriften und die genaue Verortung im Bild.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.