Originalarbeiterreichbar
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
Der Messaufbau zum Positionspapier, vom 27.05.2026: 106 abgeschottete Aufgaben, mehrere Umgebungen über mehrere Modelle, 5.194 Läufe. Zählt die Bestandteile einer Agentenumgebung in einer Reihe auf und liefert den Befund, dass eine Fähigkeit dem Paar aus Modell und Umgebung zuzurechnen ist. Benennt außerdem eine wiederkehrende Fehlerart, bei der die Überlegung des Modells sich von der Rückmeldung der Tools löst.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
the harness: the system layer that manages context, tools, state, constraints, permissions, tracing, and recovery
bestätigt 24.09.2026Across 5,194 execution trajectories, we observe substantial variation in completion, process quality, efficiency, and failure behavior across model-harness pairings
bestätigt 24.09.2026agent capability should be reported at the model-harness configuration level rather than attributed to the base model alone
bestätigt 24.09.2026recurring execution-alignment failures, where plausible reasoning becomes decoupled from tool feedback, workspace state, evidence, or verifiable output contracts
bestätigt 24.09.2026