Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenAgenten und HarnessKapitel 04von 4 im Pfad

Der Harness

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Kapitel 01 nennt das Wort und lässt es stehen: Das Programm um das Modell herum heißt Harness, und seine Teile verteilen sich über die folgenden Kapitel. Hier kommen sie zusammen, samt der Frage, wie viel dieses Drumherum eigentlich ausmacht.

Alles, was nicht das Modell ist

Die Formel, mit der der Begriff heute erklärt wird, ist denkbar knapp:

Agent = Model + Harness (externe Seite, blog.langchain.com)

Und die Abgrenzung dazu ebenso:

A harness is every piece of code, configuration, and execution logic that isn’t the model itself. (externe Seite, blog.langchain.com)

Das Modell kaufen Sie ein. Den Harness bauen Sie. Er ist der Teil, an dem Sie etwas ändern können, ohne auf die nächste Modellgeneration zu warten.

Woraus er besteht

Eine Arbeit vom Mai 2026 zählt die Bestandteile in einer Reihe auf:

the harness: the system layer that manages context, tools, state, constraints, permissions, tracing, and recovery (externe Seite, arxiv.org)

Übersetzt, und in der Reihenfolge, in der man sie beim Bauen antrifft:

Jeder dieser Punkte hat ein eigenes Kapitel. Was hier hinzukommt, ist die Beobachtung, dass sie zusammen eine Stellgröße bilden.

Wie viel das ausmacht

Im Februar 2026 hat LangChain den eigenen Coding-Agenten gemessen, bevor und nachdem das Team an der Umgebung gearbeitet hatte:

We used a simple recipe to iteratively improve deepagents-cli (our coding agent) 13.7 points from 52.8 to 66.5 on Terminal Bench 2.0 (externe Seite, blog.langchain.com)

Entscheidend ist der Satz daneben:

We only tweaked the harness and kept the model fixed (externe Seite, blog.langchain.com)

Punkte wovon? Terminal-Bench ist ein Test für Agenten, die an einer Kommandozeile arbeiten:

From compiling code to training models and setting up servers, Terminal-Bench evaluates how well agents can handle real-world, end-to-end tasks (externe Seite, github.com)

Jede Aufgabe gilt am Ende als gelöst oder nicht, und die Punktzahl ist der Anteil der gelösten. 52,8 heißt also: gut die Hälfte. Nach der Arbeit an der Umgebung waren es zwei von dreien, und das Modell war dasselbe geblieben. In der Rangliste war das der Weg von Platz 30 in die ersten fünf.

Zweimal dasselbe Modell in zwei verschiedenen Umgebungen, mit zwei verschiedenen Ergebnissen. Links ein Kasten Modell, daneben ein Kasten mit Anweisung, Tools, Schleife und Prüfung in der Fassung, wie sie geliefert wurde; darunter das Ergebnis 52,8 Punkte. Rechts dasselbe Modell, daneben dieselben Bestandteile überarbeitet; darunter 66,5 Punkte. Gemessen von LangChain im Februar 2026 auf Terminal-Bench 2.0. VORHER NACH DER ARBEIT AM HARNESS Modell Anweisung, Tools, Schleife, Prüfung wie geliefert 52,8 Punkte Modell Anweisung, Tools, Schleife, Prüfung überarbeitet 66,5 Punkte dasselbe wie links Terminal-Bench 2.0, gemessen von LangChain im Februar 2026. Anteil gelöster Aufgaben, eigene Messung des Anbieters.

seitlich verschiebbar

Dasselbe Modell in zwei Umgebungen. Was sich geändert hat, steht rechts im Kasten daneben; die Punktzahl ist der Anteil gelöster Aufgaben.

eigene Darstellung nach LangChain 2026, Stand 29.08.2026

Drei Vorbehalte gehören dazu. Der Anbieter misst sein eigenes Werkzeug. Die Zahl gilt für diesen einen Test. Und sie gilt für dessen Fassung 2.0, denn der Test wird planmäßig überholt:

As model and agent capabilities increase, it is essential that Terminal-Bench remain on the frontier (externe Seite, tbench.ai)

Die Größenordnung ist trotzdem kein Einzelfall. Ein Positionspapier vom Mai 2026 fasst den Stand so zusammen:

performance variance is governed more by harness configuration than by model choice (externe Seite, arxiv.org)

Was eine solche Zahl aussagt und was sie offenlässt, steht in Beurteilen und Einordnen, Kapitel 04.

Das gilt über das Programmieren hinaus

Die zitierten Messungen stammen aus der Softwareentwicklung, weil dort am meisten gemessen wird. Die Posten selbst hängen an keinem Fachgebiet.

Ein Sprachagent am Telefon hat dieselben sieben: Er bekommt Anweisungen, darf Tools aufrufen, führt einen Gesprächszustand mit, kennt Grenzen und Rechte, schreibt mit, und muss wissen, was bei einem Fehlschlag passiert. Der Pfad Conversational AI behandelt sie unter anderen Namen, etwa als Conversational AI, Kapitel 07 und als Conversational AI, Kapitel 08. Dasselbe gilt für eine Automatisierung, die nachts Dokumente sichtet.

Wer eine Gesamtlösung baut, entscheidet damit über die sieben Posten, ob ihm das bewusst ist oder nicht. Eine Voreinstellung ist auch eine Entscheidung, und meistens eine, die jemand anders getroffen hat.

Was daraus folgt

Wer die Ergebnisse eines Agenten verbessern will, hat zwei Hebel. Der eine ist das Modell, und darauf wartet man. Der andere liegt im eigenen Haus und lässt sich heute anfassen.

Deshalb heißt der Pfad, in dem dieses Kapitel steht, „Agenten und Harness“. Die Kapitel davor und danach handeln von den einzelnen Teilen. Die Frage, in welcher Reihenfolge man sie anfasst, beantwortet Ebene 2.

Quellen

9 Einträge, davon 3 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitAnkündigung des Herstellerserreichbar

    Improving Deep Agents with harness engineering (externe Seite, blog.langchain.com)

    blog.langchain.comgeprüft 24.09.2026

    Vivek Trivedy beschreibt am 17.02.2026, wie LangChain den eigenen Coding-Agenten um 13,7 Punkte verbesserte, ohne das Modell zu wechseln. Die konkreteste öffentlich bezifferte Messung zur Wirkung einer Agentenumgebung, und zugleich eine Eigenmessung des Anbieters an seinem eigenen Werkzeug. Drei Wochen vor derselben Feder die Formel aus der Anatomie-Fassung.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Stop Comparing LLM Agents Without Disclosing the Harness (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Ein Positionspapier vom 07.05.2026, das die Umgebung zur eigentlichen Stellgröße erklärt. Es benennt die Bestandteile eines Harness einzeln (Kontextaufbau, Tool-Verkehr, Ablaufsteuerung, Prüfung) und hält fest, dass heutige Vergleiche Verbesserungen der Umgebung dem Modell zuschreiben. Die stärkste verfügbare Belegstelle für die Frage, wie viel der Aufbau um ein Modell herum ausmacht.

  • SchlüsselarbeitOriginalarbeiterreichbar

    SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Yang und Mitautoren untersuchen am 06.05.2024, wie stark die Gestaltung der Schnittstelle die Leistung eines Agenten verändert, und bauen dafür eine eigene: wenige einfache Befehle zum Ansehen, Suchen und Ändern von Dateien statt der vollen Shell. Die frühe Belegstelle dafür, dass die Umgebung ein eigener Gegenstand ist, zwei Jahre bevor der Begriff Harness dafür aufkam.

  • Artikelerreichbar

    The Anatomy of an Agent Harness (externe Seite, blog.langchain.com)

    blog.langchain.comgeprüft 24.09.2026

    Vivek Trivedy zieht am 11.03.2026 die Definition nach, die sich durchgesetzt hat: Alles, was nicht das Modell ist, gehört zum Harness. Die Quelle für die Formel, mit der der Begriff heute erklärt wird.

  • Originalarbeiterreichbar

    Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Der Messaufbau zum Positionspapier, vom 27.05.2026: 106 abgeschottete Aufgaben, mehrere Umgebungen über mehrere Modelle, 5.194 Läufe. Zählt die Bestandteile einer Agentenumgebung in einer Reihe auf und liefert den Befund, dass eine Fähigkeit dem Paar aus Modell und Umgebung zuzurechnen ist. Benennt außerdem eine wiederkehrende Fehlerart, bei der die Überlegung des Modells sich von der Rückmeldung der Tools löst.

  • Artikelerreichbar

    Harness Engineering, first thoughts (externe Seite, martinfowler.com)

    martinfowler.comgeprüft 24.09.2026

    Birgitta Böckeler greift den Begriff am 17.02.2026 auf, zwölf Tage nach der Prägung. Die Quelle für die Geschwindigkeit der Übernahme und dafür, dass die Herkunft damals noch offen benannt wurde: Sie führt den Ausdruck auf Hashimoto zurück und merkt an, dass der Beitrag von OpenAI, der ihn im Titel führt, ihn im Text ein einziges Mal verwendet.

  • Originalarbeiterreichbar

    OpenAI, Harness engineering: leveraging Codex in an agent-first world (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Ryan Lopopolo berichtet am 11. Februar 2026 über ein Team, das fünf Monate lang ein Produkt gebaut hat, ohne eine Zeile von Hand zu schreiben. Der Wert des Berichts liegt in den Nebenwirkungen, die er offenlegt: Der Agent wiederholt vorhandene Muster einschließlich der schlechten, das Team verbrachte einen Tag der Woche mit Aufräumen, bis es die Regeln maschinell verankerte. Auch das Datum zählt, denn der Begriff Harness stand sechs Tage vorher zum ersten Mal geschrieben.

  • Ankündigung des Herstellerserreichbar

    How two API settings improved GPT-5.6 performance on ARC-AGI-3 (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Beschreibt die zwei API-Einstellungen, Reasoning beibehalten und Kompaktierung aktivieren, und die dadurch verdreifachten ARC-AGI-3-Werte von GPT-5.6, Beleg für die Kernaussage der Meldung.

  • Artikelerreichbar

    My AI Adoption Journey (externe Seite, mitchellh.com)

    mitchellh.comgeprüft 24.09.2026

    Mitchell Hashimoto beschreibt am 05.02.2026 seinen Weg zur Arbeit mit Agenten. Der fünfte Abschnitt heißt „Engineer the Harness“ und ist die Stelle, an der das Wort seine heutige Bedeutung bekommt: Der Autor sagt selbst, dass er keinen eingeführten Ausdruck dafür kennt, und vergibt einen. Damit ist die Prägung belegt und zugleich, dass es vorher keinen Namen gab.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.