BeiträgeFachartikel

Dasselbe Modell, dreifacher Wert

OpenAI hat den ARC-AGI-3-Test noch einmal gefahren, ohne am Modell etwas zu ändern, und kommt von 13,3 auf 38,3 Prozent. Verändert wurde nur die Umgebung, in der das Modell arbeitet. Was das für jede Benchmark-Zahl bedeutet, die man liest.

FachartikelStand Lesezeit 3 min

Im Februar 2026 beschrieb Mitchell Hashimoto einen Arbeitsschritt, für den es keinen Namen gab, und vergab ihn selbst: Harness, alles außer dem Modell. Gebraucht wurde das Wort, weil die Angabe des Modells nicht mehr erklärte, warum zwei Systeme verschieden gut arbeiten.

Ein halbes Jahr später gibt es die Zahl dazu, und sie kommt von einem Anbieter über sein eigenes Modell. OpenAI hat den Test ARC-AGI-3 noch einmal gefahren, mit demselben GPT-5.6 Sol, und kommt von 13,3 auf 38,3 Prozent. Menschliche Tester liegen nach Schätzung des Anbieters bei 48 Prozent. Am Modell wurde nichts verändert.

Was verändert wurde

Zwei Einstellungen der Umgebung, in der das Modell die Spiele bedient.

Die Gedankenkette blieb erhalten. Ein Modell dieser Bauart denkt vor jeder Ausgabe in Nachrichten, die der Anwender nicht sieht. Die offizielle Umgebung warf sie nach jedem Spielzug weg. Das Modell sah danach zwar noch, welche Züge es gemacht hatte, aber nicht mehr, warum. Es begann bei jedem Zug von vorn und musste das Spiel neu erschließen.

Der Verlauf wurde zusammengefasst statt abgeschnitten. Die offizielle Umgebung verwarf die ältesten Nachrichten, sobald der Verlauf 175.000 Zeichen überschritt. Das Modell verlor damit seine Gedanken, und nach und nach auch seine Züge. Die Alternative fasst den Verlauf zusammen, bevor er zu lang wird, und behält so, was gelernt wurde.

Beides zusammen kostete nebenbei sechsmal weniger Ausgabe-Token, was den Ergebnissen widerspricht, die man erwartet: Das Modell wurde nicht gesprächiger, es wurde kürzer, weil es sich nicht mehr in jedem Zug neu sortieren musste. Was Grundkurs, Kapitel 03 über die Abrechnung sagt, gilt also in beide Richtungen. Eine schlechte Umgebung kostet zweimal, in der Qualität und im Verbrauch.

Warum der Test es überhaupt anders macht

Das Naheliegende wäre, das für einen Fehler der Testumgebung zu halten. Es ist eine Entscheidung, und sie hat einen Grund.

ARC baut die Umgebung bewusst schlicht, ohne Tools und Sonderausstattung. Nach der Darstellung von OpenAI ist die Überlegung dahinter, dass eine einfache Umgebung die Schwächen eines Modells sichtbarer macht und Modelle untereinander fairer vergleichbar hält. Wer jedem Anbieter erlaubt, seine eigene Umgebung mitzubringen, misst am Ende die Umgebungen.

Die Gegenposition steht im selben Text: Wer ein Produkt baut, stimmt die Umgebung auf sein Modell ab, und genau so wird das Modell später auch eingesetzt. Eine Zahl aus einer Umgebung, die niemand benutzt, misst dann etwas, das es im Betrieb nicht gibt.

Beide Positionen sind vertretbar, und sie messen verschiedene Dinge. Das ist der eigentliche Befund: Eine Zahl aus einem Test beantwortet die Frage nicht, solange nicht dabeisteht, welche der beiden Fragen sie beantwortet.

Was daraus für das Lesen von Ranglisten folgt

Drei Fragen, die eine Benchmark-Zahl beantwortbar machen.

In welcher Umgebung wurde gemessen? Bleibt die Gedankenkette erhalten? Wie wird mit einem vollen Kontextfenster umgegangen? Standen Tools zur Verfügung? Ohne diese Angaben ist der Vergleich zweier Modelle ein Vergleich zweier Paare aus Modell und Umgebung, von denen man nur eine Hälfte kennt.

Wer hat gemessen? Der Fall hier ist eine Eigenmessung. OpenAI misst das eigene Modell und veröffentlicht dazu die Empfehlung, die eigene Schnittstelle zu verwenden. Das entwertet die Zahlen nicht, sie sind nachvollziehbar beschrieben, aber es ordnet sie ein: Ein Anbieter, der zeigt, wie gut sein Modell in der besten Umgebung arbeitet, hat ein Interesse an dem Ergebnis.

Was misst die Metrik? ARC-AGI-3 vergleicht die Zahl der Aktionen mit einem menschlichen Maßstab und rechnet nicht in gelösten Aufgaben. 38,3 Prozent heißt nicht, dass 38 von 100 Aufgaben gelöst wurden. Ohne diese Angabe liest man eine Prozentzahl als Schulnote, und das ist sie nicht.

Der Teil, der bleibt

Der Begriff Harness entstand aus einer Beobachtung ohne Zahlen: Zwei Leute arbeiten mit demselben Modell, einer kommt weiter. Was hier dazugekommen ist, ist die Größenordnung. Der Unterschied zwischen zwei Umgebungen kann größer sein als der zwischen zwei Modellgenerationen, und er entsteht aus Entscheidungen, die in keiner Modellkarte stehen.

Für die Praxis heißt das weniger, als es klingt, und mehr, als man denkt. Weniger, weil niemand seine Werkzeuge nach einer Benchmark aussuchen sollte. Mehr, weil die Frage „welches Modell ist besser“ die Zeit schlechter nutzt als die Frage, was das vorhandene Modell eigentlich zu sehen bekommt.

Quellen

2 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Ankündigung des Herstellerserreichbar

    How two API settings improved GPT-5.6 performance on ARC-AGI-3 (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Beschreibt die zwei API-Einstellungen, Reasoning beibehalten und Kompaktierung aktivieren, und die dadurch verdreifachten ARC-AGI-3-Werte von GPT-5.6, Beleg für die Kernaussage der Meldung.

  • Artikelerreichbar

    My AI Adoption Journey (externe Seite, mitchellh.com)

    mitchellh.comgeprüft 24.09.2026

    Mitchell Hashimoto beschreibt am 05.02.2026 seinen Weg zur Arbeit mit Agenten. Der fünfte Abschnitt heißt „Engineer the Harness“ und ist die Stelle, an der das Wort seine heutige Bedeutung bekommt: Der Autor sagt selbst, dass er keinen eingeführten Ausdruck dafür kennt, und vergibt einen. Damit ist die Prägung belegt und zugleich, dass es vorher keinen Namen gab.

Zurück zu allen Beiträgen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.