GrundlagenBeurteilen und EinordnenKapitel 04von 8 im Pfad
Was eine Benchmarkzahl sagt
Jede Ankündigung eines neuen Modells kommt mit Balken. 94 Prozent hier, Platz eins dort. Diese Zahlen sind wirklich gemessen. Die Frage ist, was sie gemessen haben.
Woraus eine solche Zahl entsteht
Ein Benchmark hat drei Teile. Einen festen Satz Aufgaben. Eine Metrik, die sagt, wann eine Antwort als richtig zählt. Und einen Messaufbau: wie die Aufgabe dem Modell vorgelegt wird, wie oft, und was dem Modell dabei zur Verfügung steht.
Alle drei liegen fest, damit zwei Modelle überhaupt vergleichbar werden. Aus dieser Festlegung folgen vier Gründe, warum die Zahl über Ihre eigene Arbeit wenig aussagt.
Erstens: Die Aufgaben können im Training gestanden haben
Ein Modell lernt aus Text, der im Netz stand. Aufgabensammlungen stehen im Netz. Wenn eine Aufgabe im Training vorkam, misst der Test das Erinnern.
Eine Gruppe um Hugh Zhang hat das 2024 sauber getrennt. Sie ließ 1205 neue Rechenaufgaben schreiben, die dem verbreiteten Test GSM8k in Stil und Schwierigkeit gleichen:
Dieselben Modelle, gleichwertige Aufgaben, und ein Ergebnis, das die Sorge bestätigt:
Der Abstract endet allerdings mit einem Satz, der in fast jeder Wiedergabe fehlt:
Wer die Arbeit als Beleg dafür nimmt, dass Bestenlisten erfunden sind, hat sie zu Ende gelesen bekommen und selbst nur bis zur Hälfte.
Zweitens: Ein Test veraltet an seinem eigenen Erfolg
MMLU war jahrelang der Wissenstest, den jede Ankündigung nannte. Genau das hat ihn unbrauchbar gemacht:
Wenn alle Spitzenmodelle zwischen 86 und 87 Prozent liegen, misst der Test Rauschen. Die Nachfolgefassung MMLU-Pro erhöhte die Zahl der Antwortmöglichkeiten von vier auf zehn und warf triviale Fragen heraus, mit sichtbarer Wirkung:
causing a significant drop in accuracy by 16% to 33% compared to MMLU (externe Seite, arxiv.org)
Ein hoher Wert kann also zwei Dinge heißen: Das Modell ist gut, oder der Test ist verbraucht. Von außen sehen beide gleich aus.
Drittens: Einmal gelingt sagt wenig über achtmal
Die meisten Zahlen sind Erfolgsquoten über einen Durchgang. Im Betrieb zählt etwas anderes, wie eine Arbeit über Agenten im Kundendialog zeigt. Sie führte eine Kennzahl ein, die fragt, ob derselbe Auftrag mehrfach hintereinander gelingt:
Das Ergebnis liegt weit auseinander:
Von den Aufgaben, die ein Agent überhaupt schafft, schafft er einen Teil nur manchmal. Wer eine Erfolgsquote von 50 Prozent liest und daraus einen Arbeitsablauf plant, plant mit einer Zahl, die den zweiten Versuch gar nicht kennt.
Viertens: Gemessen wurde auch die Umgebung
Die vierte Unbekannte steckt im Messaufbau. OpenAI hat den Test ARC-AGI-3 mit demselben Modell zweimal gefahren und kam von 13,3 auf 38,3 Prozent, indem es zwei Einstellungen der Umgebung änderte. Der Fall ist im Beitrag Dasselbe Modell, dreifacher Wert beschrieben, und was diese Umgebung alles umfasst, steht in Agenten und Harness, Kapitel 04.
Wie groß der Abstand zwischen Mensch und Maschine dort noch ist, sagt die Ankündigung des Tests selbst:
Humans score 100%. Frontier AI scores 0.51%. (externe Seite, arcprize.org)
seitlich verschiebbar
eigene Darstellung, Stand 29.08.2026
Was davon für Sie bleibt
Eine fremde Zahl beantwortet die Frage, welches Modell auf diesem Aufgabensatz in diesem Aufbau vorn lag. Ihre Frage lautet, welches Modell Ihre Arbeit erledigt. Der Weg von der einen zur anderen Antwort führt über einen eigenen Vergleich, und wie der aussieht, steht in Grundkurs, Kapitel 10. Und wo die Zahlen des Herstellers samt ihrer Erhebung stehen, sagt Kapitel 07.
Eine Testzahl entsteht aus drei Festlegungen, und jede davon ist eine Entscheidung, die jemand getroffen hat. Wer die drei kennt, liest eine Rangliste anders.
Der Aufgabensatz
Ein Test besteht aus einer festen Sammlung von Aufgaben mit hinterlegten Lösungen. Diese Sammlung ist eine Stichprobe, gezogen von Menschen, mit einer Absicht.
Die Absicht ist selten neutral. ARC etwa lässt Sprache und Fachwissen absichtlich weg, weil ein auf Text trainiertes Modell damit einen Vorsprung hätte, den der Test gerade prüfen will. Zugelassen ist,
Die Kurzformel der Betreiber dazu lautet Easy for Humans, Hard for AI (externe Seite, arcprize.org). Ein solcher Test ist mit Absicht so gebaut, dass er Modelle schlecht aussehen lässt, und das ist seine Aussage.
Umgekehrt gilt dasselbe: Ein Aufgabensatz, dessen Fragen im Trainingsmaterial standen, lässt Modelle gut aussehen. Die GSM1k-Arbeit hat dafür den Begriff geliefert, um den es geht:
Der englische Fachausdruck dafür ist Kontamination. Sie lässt sich von außen nicht sehen, weil niemand die Trainingsdaten der großen Modelle kennt. Messen kann man sie nur so, wie die Arbeit es getan hat: mit einem zweiten, gleichwertigen Aufgabensatz, den es vorher nicht gab.
Die Metrik
Die Metrik sagt, was gezählt wird. Eine Prozentzahl liest sich wie eine Schulnote, und oft ist sie etwas völlig anderes.
Bei ARC-AGI-3 werden Aktionen gezählt und mit einem menschlichen Maßstab verglichen. Ein Wert von 38,3 Prozent bedeutet dort also keine Lösungsquote von 38 von 100 Aufgaben. Wie weit die Skala reicht, sagt die Ankündigung:
Humans score 100%. Frontier AI scores 0.51%. (externe Seite, arcprize.org)
Der Test ist dabei ausdrücklich als erster interaktiver seiner Reihe angelegt,
the first fully interactive benchmark in the ARC-AGI series (externe Seite, arcprize.org)
und misst damit etwas anderes als seine Vorgänger: Der Agent bekommt eine Spielumgebung ohne Anleitung und muss selbst herausfinden, was Gewinnen bedeutet.
Die zweite Frage an jede Metrik lautet, wie oft gemessen wurde. Der Test tau-bench hat dafür die Kennzahl pass hoch k eingeführt, die nach mehreren Versuchen fragt:
Bewertet wird dort am Endzustand der Datenbank,
was eine eigene Entscheidung ist: Der Weg dorthin zählt nicht, das Ergebnis schon.
Der Messaufbau
Die dritte Festlegung ist die unauffälligste, weil sie in keiner Rangliste steht. Wie wird die Aufgabe formuliert? Darf das Modell vorher nachdenken? Was passiert, wenn der Verlauf zu lang wird?
Wie stark das wiegt, hat die MMLU-Pro-Arbeit beziffert. Sie fuhr denselben Test mit 24 verschiedenen Formulierungen:
Vier bis fünf Prozentpunkte allein aus der Formulierung. In einer Rangliste, in der die Spitze zwischen 86 und 87 Prozent liegt, ist das mehr als der Abstand zwischen Platz eins und Platz fünf.
Die Leute hinter der verbreitetsten Messvorrichtung haben aufgeschrieben, was drei Jahre Betrieb sie gelehrt haben. Ihr erster Satz ist eine Bilanz:
Reliable evaluation of language models (LMs) remains an open challenge (externe Seite, arxiv.org)
Als Ursachen nennen sie unter anderem the sensitivity of models to evaluation setup (externe Seite, arxiv.org) und the lack of reproducibility and transparency (externe Seite, arxiv.org).
Wer gemessen hat
Fast alle Zahlen in Modellankündigungen sind Eigenmessungen. Das entwertet sie noch nicht, denn viele sind nachvollziehbar beschrieben. Es ordnet sie ein: Wer sein eigenes Modell misst und dabei den Messaufbau wählt, hat ein Interesse am Ergebnis.
Der Gegenentwurf sind Ranglisten, in denen Menschen abstimmen. Chatbot Arena lässt zwei anonyme Modelle dieselbe Frage beantworten und zählt, welche Antwort gewinnt. Die Rangzahl stammt aus dem Schachsport:
The Elo rating system has also been used for LLMs (externe Seite, arxiv.org)
Auch dieses Verfahren hat seine Eigenheiten, und die Arbeit sagt es selbst:
Die Rangzahl hängt also an der Rechenweise der Plattform, und die hat sich schon geändert. Inzwischen läuft dasselbe Verfahren auch für Agenten:
Was Menschen bei einem Paarvergleich bewerten, ist der Eindruck einer Antwort. Fachliche Richtigkeit prüfen sie nur, soweit sie sie beurteilen können.
Wie man eine Ankündigung liest
Aus den drei Teilen ergeben sich drei Fragen, die sich an jeder Ankündigung beantworten lassen, meistens in wenigen Minuten.
- Welcher Aufgabensatz, und wie alt ist er? Ein Test, den die Spitze ausgereizt hat, unterscheidet nichts mehr.
- Was zählt die Metrik, und über wie viele Durchgänge? Aktionen, gelöste Aufgaben und Stimmen von Menschen sind drei verschiedene Größen.
- Wer hat gemessen, und ist der Aufbau beschrieben? Ohne diese Angabe vergleichen Sie zwei Paare aus Modell und Umgebung, von denen Sie je eine Hälfte kennen.
Zwei Kennzahlen sehen fast gleich aus und beantworten entgegengesetzte Fragen. Der Unterschied zwischen ihnen ist die ganze Differenz zwischen einer Ankündigung und einem Betriebsplan.
pass@k und pass hoch k
pass@k fragt: Gelingt die Aufgabe in k Versuchen mindestens einmal? Die Kennzahl stammt aus der Programmierbewertung, wo man mehrere Vorschläge erzeugt und den besten nimmt. Sie steigt mit k, denn mehr Versuche können nur helfen.
pass hoch k fragt das Gegenteil: Gelingt die Aufgabe in k Versuchen jedes Mal? Diese Kennzahl fällt mit k. Eingeführt wurde sie in tau-bench:
Wer eine Zahl liest, in der ein k vorkommt, sollte also zuerst nachsehen, in welche Richtung sie zeigt. Ein hoher pass@8-Wert und ein hoher pass-hoch-8-Wert sind zwei sehr verschiedene Zusagen.
Was die Streuung über die Aufgaben verrät
Die gemessenen Werte lohnen eine Rechnung. Beide sind im Abstract als Schranken angegeben:
Angenommen, jeder Versuch gelänge unabhängig von den anderen mit der Wahrscheinlichkeit 0,5. Dann wäre die Wahrscheinlichkeit für acht Erfolge hintereinander 0,5 hoch 8, also 0,39 Prozent. Gemessen sind bis zu 25 Prozent, also das rund Sechzigfache.
Daraus folgt etwas über die Verteilung. Die Unsicherheit sitzt zu einem großen Teil zwischen den Aufgaben statt in den Wiederholungen: Ein Teil der Aufgaben gelingt zuverlässig, ein anderer scheitert zuverlässig, und dazwischen liegt der Bereich, der wackelt. Grob gerechnet gelingt etwa die Hälfte dessen, was einmal klappt, auch achtmal.
Zwei Vorbehalte zur Rechnung. Erstens sind beide Werte Obergrenzen, der tatsächliche Abstand kann anders ausfallen. Zweitens gilt sie für einen bestimmten Aufgabenbereich dieses einen Tests. Die Größenordnung überträgt sich trotzdem: Eine Erfolgsquote je Einzelversuch beschreibt einen Arbeitsablauf schlecht, in dem derselbe Vorgang hundertmal am Tag laufen soll.
Woher die Streuung überhaupt kommt, steht in Grundkurs, Kapitel 12: Dasselbe Modell zieht bei jeder Anfrage neu aus einer Rangliste möglicher Fortsetzungen.
Was Chollet messen wollte
Die schärfste Kritik am Prinzip Aufgabensammlung ist so alt wie der Test, der sie ausgelöst hat. François Chollet stellte ARC 2019 in einer Arbeit vor, die Intelligenz umdefiniert,
describing intelligence as skill-acquisition efficiency (externe Seite, arxiv.org)
und die Betreiber des Tests fassen es heute so zusammen:
Der Punkt daran ist eine Falle, in die jede feste Aufgabensammlung läuft. Chollet hält in derselben Arbeit fest, dass sich beliebige Fertigkeiten erkaufen lassen, wenn man dem System genug Vorwissen oder genug Trainingsdaten mitgibt. Eine Punktzahl an einer bekannten Sammlung misst dann den Einkauf.
Der Maßstab, an dem sich das Feld nach dieser Lesart messen lassen müsste, steht ebenfalls dort:
AGI is a system that can match the learning efficiency of humans. (externe Seite, arcprize.org)
Das ist eine Aussage über Lerngeschwindigkeit bei unbekannten Aufgaben. Kein verbreiteter Test misst sie, und das erklärt, warum die Werte auf ARC-AGI-3 so weit von den Werten auf Wissenstests entfernt liegen.
Die Messvorrichtung als eigene Fehlerquelle
Das Wort Harness hatte im Messwesen schon eine Bedeutung, bevor es die Umgebung eines Agenten bezeichnete. Die erste Ausgabe der verbreitetsten Vorrichtung von 2021 nennt sich im Titel
Evaluation Harness for Large Language Models (externe Seite, github.com)
und beschreibt ihren Zweck so:
Eine Vorrichtung, in die man ein Modell einspannt, damit alle gleich gemessen werden. Nach drei Jahren Betrieb haben die Beteiligten ihre Erfahrungen aufgeschrieben, und der lehrreichste Satz betrifft die Weitergabe des Wissens. Sie wollten
Handwerkswissen, das mündlich weitergegeben wird. Wer eine Zahl aus einer Veröffentlichung nachbaut und andere Werte erhält, hat oft an genau dieser Stelle eine Annahme anders getroffen.
Was das für den eigenen Prüfstand heißt
Die Schlüsse aus alldem sind unbequem, weil sie Arbeit bedeuten.
Ein eigener Aufgabensatz veraltet ebenfalls. Wer zwanzig echte Fälle sammelt und ein Jahr lang dagegen misst, hat am Ende ein Modell, das auf diese zwanzig Fälle abgestimmt wurde. Die Sammlung braucht Zulauf.
Ein eigener Aufgabensatz gehört nirgends ins Netz. Sonst steht er im nächsten Trainingslauf, und die GSM1k-Arbeit hat gezeigt, was daraus folgt:
Mehrere Durchgänge je Fall. Ein einzelner Lauf misst die Zufälligkeit der Erzeugung mit. Wie ein solcher Prüfstand aussieht, steht in Vibe-Coding / Agentic Engineering, Kapitel 07, und für Gesprächssysteme in Conversational AI, Kapitel 10.
Der Messaufbau gehört ins Protokoll. Modellfassung, Systemanweisung, Tools, Zeitpunkt. Ohne diese vier Angaben kann ein halbes Jahr später niemand mehr sagen, ob eine Verschlechterung vom Modell kam oder von der eigenen Einstellung. Wie weit diese Angaben reichen müssen, führt Agenten und Harness, Kapitel 04 aus: Bei Aufgaben über viele Schritte bewegt die Umgebung gemessen mehr als die Modellwahl.
Quellen
10 Einträge, davon 4 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Zhang und Mitautoren lassen 1205 Rechenaufgaben neu schreiben, die dem verbreiteten Test GSM8k in Stil, Schwierigkeit und Lösungsschritten gleichen, und messen dieselben Modelle daran. Der Vergleich trennt zum ersten Mal sauber, was Können ist und was Wiedererkennen. Wichtig ist der Schlusssatz des Abstracts, der in jeder Wiedergabe fehlt: Die stärksten Modelle zeigen kaum Anzeichen von Überanpassung, und alle Modelle lösen auch die neuen Aufgaben.
SchlüsselarbeitOriginalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Yao und Mitautoren stellen einen Test vor, in dem ein Agent mit einem simulierten Kunden spricht und dabei Regeln einhalten muss. Gemessen wird am Zustand der Datenbank am Ende. Der bleibende Beitrag ist die Kennzahl pass hoch k: Sie fragt, ob derselbe Auftrag k mal hintereinander gelingt, und trennt damit Können von Verlässlichkeit.
SchlüsselarbeitOriginalarbeiterreichbar
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit von Chiang und zehn Mitautoren vom 07.03.2024, die Chatbot Arena vorstellt: Sprachmodelle treten anonym im Paarvergleich an, aus den Stimmen von Menschen entsteht eine Rangzahl. Hält fest, dass die Plattform dafür zunächst den Elo-Wert aus dem Schach übernahm und ihn später durch Bradley-Terry-Koeffizienten ersetzte.
SchlüsselarbeitOriginalarbeiterreichbar
On the Measure of Intelligence (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit, in der François Chollet 2019 den Test ARC vorstellt. Sie begründet zugleich, warum eine Punktzahl an einer festen Aufgabensammlung wenig über Intelligenz sagt: Wer genug Vorwissen und Trainingsdaten hineingibt, kann sich beliebige Fertigkeiten erkaufen. Chollet setzt dagegen die Lerneffizienz, also die Geschwindigkeit, mit der ein System aus Erfahrung eine neue Fähigkeit gewinnt.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Wang und Mitautoren bauen den verbreiteten Wissenstest MMLU um, weil die Spitzenmodelle darin dicht beieinanderlagen und der Test damit aufgehört hatte, sie zu unterscheiden. Vier Antwortmöglichkeiten werden zu zehn, triviale Fragen fliegen heraus. Der Beleg für zwei Sachen zugleich: dass ein Test durch Erfolg unbrauchbar wird, und wie stark eine Punktzahl allein von der Formulierung der Aufgabe abhängt.
Ankündigung des Herstellerserreichbar
Announcing ARC-AGI-3 (externe Seite, arcprize.org)
arcprize.orggeprüft 24.09.2026
Die Vorstellung der dritten Fassung am 25.03.2026. Sie misst etwas anderes als ihre beiden Vorgänger: Der Agent bekommt eine Spielumgebung ohne Anleitung, ohne Regeln und ohne genanntes Ziel und muss selbst herausfinden, was Gewinnen bedeutet. Beleg auch für den Abstand zwischen Mensch und Maschine zum Zeitpunkt der Veröffentlichung.
Dokumentationerreichbar
ARC-AGI Series, Benchmarks for General Intelligence (externe Seite, arcprize.org)
arcprize.orggeprüft 24.09.2026
Die Übersichtsseite der ARC Prize Foundation, die den Test seit Chollets Arbeit weiterführt. Erklärt den Zuschnitt der Aufgaben: Zugelassen ist nur, was ein Mensch sehr früh mitbringt, damit Sprache und Fachwissen keiner Seite einen Vorsprung geben. Hier steht auch die ausgeschriebene Fassung der Abkürzung mit dem angehängten AGI.
Dokumentationerreichbar
Agent Arena, Rangliste von Arena Intelligence (externe Seite, arena.ai)
arena.aigeprüft 24.09.2026
Die laufend aktualisierte Rangliste, mit der Arena Intelligence (vormals LMArena) den Elo-Wert aus Chatbot Arena auf Agenten überträgt. Bewertet werden Tool-Einsatz, Aufgabenerfüllung und Lenkbarkeit aus Paarvergleichen. Am 11.08.2026 standen 47 Modelle aus 1.746.922 Sitzungen in der Liste.
Originalarbeiterreichbar
Lessons from the Trenches on Reproducible Evaluation of Language Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Biderman, Schoelkopf und 29 weitere Mitautoren schreiben auf, was drei Jahre Betrieb der verbreiteten Messvorrichtung lm-eval gelehrt haben. Der Text ist die Belegstelle dafür, dass eine Punktzahl auch vom Messaufbau abhängt und dass vieles daran als stilles Handwerkswissen weitergegeben wird statt dokumentiert zu sein.
Werkzeugerreichbar
Evaluation Harness for Large Language Models (externe Seite, github.com)
github.comgeprüft 24.09.2026
Der Stand der ersten Ausgabe vom 02.09.2021, festgehalten über deren Kennung statt über den heutigen Branch. Beleg für die ältere Bedeutung des Wortes: Harness ist hier die Vorrichtung, in die ein Modell zum Messen eingespannt wird, nicht die Umgebung, in der es arbeitet.