Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenBeurteilen und EinordnenKapitel 04von 8 im Pfad

Was eine Benchmarkzahl sagt

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Jede Ankündigung eines neuen Modells kommt mit Balken. 94 Prozent hier, Platz eins dort. Diese Zahlen sind wirklich gemessen. Die Frage ist, was sie gemessen haben.

Woraus eine solche Zahl entsteht

Ein Benchmark hat drei Teile. Einen festen Satz Aufgaben. Eine Metrik, die sagt, wann eine Antwort als richtig zählt. Und einen Messaufbau: wie die Aufgabe dem Modell vorgelegt wird, wie oft, und was dem Modell dabei zur Verfügung steht.

Alle drei liegen fest, damit zwei Modelle überhaupt vergleichbar werden. Aus dieser Festlegung folgen vier Gründe, warum die Zahl über Ihre eigene Arbeit wenig aussagt.

Erstens: Die Aufgaben können im Training gestanden haben

Ein Modell lernt aus Text, der im Netz stand. Aufgabensammlungen stehen im Netz. Wenn eine Aufgabe im Training vorkam, misst der Test das Erinnern.

Eine Gruppe um Hugh Zhang hat das 2024 sauber getrennt. Sie ließ 1205 neue Rechenaufgaben schreiben, die dem verbreiteten Test GSM8k in Stil und Schwierigkeit gleichen:

GSM1k is designed to mirror the style and complexity of the established GSM8k benchmark (externe Seite, arxiv.org)

Dieselben Modelle, gleichwertige Aufgaben, und ein Ergebnis, das die Sorge bestätigt:

we observe accuracy drops of up to 8%, with several families of models showing evidence of systematic overfitting across almost all model sizes (externe Seite, arxiv.org)

Der Abstract endet allerdings mit einem Satz, der in fast jeder Wiedergabe fehlt:

many models, especially those on the frontier, show minimal signs of overfitting (externe Seite, arxiv.org)

Wer die Arbeit als Beleg dafür nimmt, dass Bestenlisten erfunden sind, hat sie zu Ende gelesen bekommen und selbst nur bis zur Hälfte.

Zweitens: Ein Test veraltet an seinem eigenen Erfolg

MMLU war jahrelang der Wissenstest, den jede Ankündigung nannte. Genau das hat ihn unbrauchbar gemacht:

their performance on these benchmarks has begun to plateau, making it increasingly difficult to discern differences in model capabilities (externe Seite, arxiv.org)

Wenn alle Spitzenmodelle zwischen 86 und 87 Prozent liegen, misst der Test Rauschen. Die Nachfolgefassung MMLU-Pro erhöhte die Zahl der Antwortmöglichkeiten von vier auf zehn und warf triviale Fragen heraus, mit sichtbarer Wirkung:

causing a significant drop in accuracy by 16% to 33% compared to MMLU (externe Seite, arxiv.org)

Ein hoher Wert kann also zwei Dinge heißen: Das Modell ist gut, oder der Test ist verbraucht. Von außen sehen beide gleich aus.

Drittens: Einmal gelingt sagt wenig über achtmal

Die meisten Zahlen sind Erfolgsquoten über einen Durchgang. Im Betrieb zählt etwas anderes, wie eine Arbeit über Agenten im Kundendialog zeigt. Sie führte eine Kennzahl ein, die fragt, ob derselbe Auftrag mehrfach hintereinander gelingt:

We also propose a new metric (pass^k) to evaluate the reliability of agent behavior over multiple trials (externe Seite, arxiv.org)

Das Ergebnis liegt weit auseinander:

succeed on <50% of the tasks, and are quite inconsistent (pass^8 <25% in retail) (externe Seite, arxiv.org)

Von den Aufgaben, die ein Agent überhaupt schafft, schafft er einen Teil nur manchmal. Wer eine Erfolgsquote von 50 Prozent liest und daraus einen Arbeitsablauf plant, plant mit einer Zahl, die den zweiten Versuch gar nicht kennt.

Viertens: Gemessen wurde auch die Umgebung

Die vierte Unbekannte steckt im Messaufbau. OpenAI hat den Test ARC-AGI-3 mit demselben Modell zweimal gefahren und kam von 13,3 auf 38,3 Prozent, indem es zwei Einstellungen der Umgebung änderte. Der Fall ist im Beitrag Dasselbe Modell, dreifacher Wert beschrieben, und was diese Umgebung alles umfasst, steht in Agenten und Harness, Kapitel 04.

Wie groß der Abstand zwischen Mensch und Maschine dort noch ist, sagt die Ankündigung des Tests selbst:

Humans score 100%. Frontier AI scores 0.51%. (externe Seite, arcprize.org)

Zweimal derselbe Wert von 74 Prozent, darunter vier Fragen, die in beiden Fällen verschieden beantwortet werden. Zweimal der Wert 74 Prozent nebeneinander. Darunter vier Fragen mit je zwei Antworten: Stand die Aufgabe im Training, geprüft nein gegen niemand weiß es. Wie voll ist der Test, weites Feld gegen alle bei 70 bis 76. Wie oft wurde gemessen, acht Läufe im Mittel gegen ein Lauf. Was stand um das Modell herum, im Protokoll gegen nicht genannt. 74 % 74 % Stand die Aufgabe im Training? geprüft, nein niemand weiß es Wie voll ist der Test? weites Feld alle bei 70 bis 76 Wie oft wurde gemessen? acht Läufe, Mittel ein Lauf Was stand um das Modell herum? im Protokoll nicht genannt Die Zahl ist dieselbe. Zu wissen ist sie nur links.

seitlich verschiebbar

Vier Fragen an dieselbe Zahl. Die Werte sind erfunden und zeigen die Form der Auskunft, nicht ein gemessenes Modell.

eigene Darstellung, Stand 29.08.2026

Was davon für Sie bleibt

Eine fremde Zahl beantwortet die Frage, welches Modell auf diesem Aufgabensatz in diesem Aufbau vorn lag. Ihre Frage lautet, welches Modell Ihre Arbeit erledigt. Der Weg von der einen zur anderen Antwort führt über einen eigenen Vergleich, und wie der aussieht, steht in Grundkurs, Kapitel 10. Und wo die Zahlen des Herstellers samt ihrer Erhebung stehen, sagt Kapitel 07.

Quellen

10 Einträge, davon 4 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    A Careful Examination of Large Language Model Performance on Grade School Arithmetic (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Zhang und Mitautoren lassen 1205 Rechenaufgaben neu schreiben, die dem verbreiteten Test GSM8k in Stil, Schwierigkeit und Lösungsschritten gleichen, und messen dieselben Modelle daran. Der Vergleich trennt zum ersten Mal sauber, was Können ist und was Wiedererkennen. Wichtig ist der Schlusssatz des Abstracts, der in jeder Wiedergabe fehlt: Die stärksten Modelle zeigen kaum Anzeichen von Überanpassung, und alle Modelle lösen auch die neuen Aufgaben.

  • SchlüsselarbeitOriginalarbeiterreichbar

    τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Yao und Mitautoren stellen einen Test vor, in dem ein Agent mit einem simulierten Kunden spricht und dabei Regeln einhalten muss. Gemessen wird am Zustand der Datenbank am Ende. Der bleibende Beitrag ist die Kennzahl pass hoch k: Sie fragt, ob derselbe Auftrag k mal hintereinander gelingt, und trennt damit Können von Verlässlichkeit.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit von Chiang und zehn Mitautoren vom 07.03.2024, die Chatbot Arena vorstellt: Sprachmodelle treten anonym im Paarvergleich an, aus den Stimmen von Menschen entsteht eine Rangzahl. Hält fest, dass die Plattform dafür zunächst den Elo-Wert aus dem Schach übernahm und ihn später durch Bradley-Terry-Koeffizienten ersetzte.

  • SchlüsselarbeitOriginalarbeiterreichbar

    On the Measure of Intelligence (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit, in der François Chollet 2019 den Test ARC vorstellt. Sie begründet zugleich, warum eine Punktzahl an einer festen Aufgabensammlung wenig über Intelligenz sagt: Wer genug Vorwissen und Trainingsdaten hineingibt, kann sich beliebige Fertigkeiten erkaufen. Chollet setzt dagegen die Lerneffizienz, also die Geschwindigkeit, mit der ein System aus Erfahrung eine neue Fähigkeit gewinnt.

  • Originalarbeiterreichbar

    MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Wang und Mitautoren bauen den verbreiteten Wissenstest MMLU um, weil die Spitzenmodelle darin dicht beieinanderlagen und der Test damit aufgehört hatte, sie zu unterscheiden. Vier Antwortmöglichkeiten werden zu zehn, triviale Fragen fliegen heraus. Der Beleg für zwei Sachen zugleich: dass ein Test durch Erfolg unbrauchbar wird, und wie stark eine Punktzahl allein von der Formulierung der Aufgabe abhängt.

  • Ankündigung des Herstellerserreichbar

    Announcing ARC-AGI-3 (externe Seite, arcprize.org)

    arcprize.orggeprüft 24.09.2026

    Die Vorstellung der dritten Fassung am 25.03.2026. Sie misst etwas anderes als ihre beiden Vorgänger: Der Agent bekommt eine Spielumgebung ohne Anleitung, ohne Regeln und ohne genanntes Ziel und muss selbst herausfinden, was Gewinnen bedeutet. Beleg auch für den Abstand zwischen Mensch und Maschine zum Zeitpunkt der Veröffentlichung.

  • Dokumentationerreichbar

    ARC-AGI Series, Benchmarks for General Intelligence (externe Seite, arcprize.org)

    arcprize.orggeprüft 24.09.2026

    Die Übersichtsseite der ARC Prize Foundation, die den Test seit Chollets Arbeit weiterführt. Erklärt den Zuschnitt der Aufgaben: Zugelassen ist nur, was ein Mensch sehr früh mitbringt, damit Sprache und Fachwissen keiner Seite einen Vorsprung geben. Hier steht auch die ausgeschriebene Fassung der Abkürzung mit dem angehängten AGI.

  • Dokumentationerreichbar

    Agent Arena, Rangliste von Arena Intelligence (externe Seite, arena.ai)

    arena.aigeprüft 24.09.2026

    Die laufend aktualisierte Rangliste, mit der Arena Intelligence (vormals LMArena) den Elo-Wert aus Chatbot Arena auf Agenten überträgt. Bewertet werden Tool-Einsatz, Aufgabenerfüllung und Lenkbarkeit aus Paarvergleichen. Am 11.08.2026 standen 47 Modelle aus 1.746.922 Sitzungen in der Liste.

  • Originalarbeiterreichbar

    Lessons from the Trenches on Reproducible Evaluation of Language Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Biderman, Schoelkopf und 29 weitere Mitautoren schreiben auf, was drei Jahre Betrieb der verbreiteten Messvorrichtung lm-eval gelehrt haben. Der Text ist die Belegstelle dafür, dass eine Punktzahl auch vom Messaufbau abhängt und dass vieles daran als stilles Handwerkswissen weitergegeben wird statt dokumentiert zu sein.

  • Werkzeugerreichbar

    Evaluation Harness for Large Language Models (externe Seite, github.com)

    github.comgeprüft 24.09.2026

    Der Stand der ersten Ausgabe vom 02.09.2021, festgehalten über deren Kennung statt über den heutigen Branch. Beleg für die ältere Bedeutung des Wortes: Harness ist hier die Vorrichtung, in die ein Modell zum Messen eingespannt wird, nicht die Umgebung, in der es arbeitet.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.