NachschlagenQuellenregister

Originalarbeiterreichbar

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

arxiv.org (externe Seite)

Der Messaufbau zum Positionspapier, vom 27.05.2026: 106 abgeschottete Aufgaben, mehrere Umgebungen über mehrere Modelle, 5.194 Läufe. Zählt die Bestandteile einer Agentenumgebung in einer Reihe auf und liefert den Befund, dass eine Fähigkeit dem Paar aus Modell und Umgebung zuzurechnen ist. Benennt außerdem eine wiederkehrende Fehlerart, bei der die Überlegung des Modells sich von der Rückmeldung der Tools löst.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:

  • the harness: the system layer that manages context, tools, state, constraints, permissions, tracing, and recoverybestätigt 24.09.2026
  • Across 5,194 execution trajectories, we observe substantial variation in completion, process quality, efficiency, and failure behavior across model-harness pairingsbestätigt 24.09.2026
  • agent capability should be reported at the model-harness configuration level rather than attributed to the base model alonebestätigt 24.09.2026
  • recurring execution-alignment failures, where plausible reasoning becomes decoupled from tool feedback, workspace state, evidence, or verifiable output contractsbestätigt 24.09.2026

03 Chancen und Grenzen04 Der Harness

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.