NachschlagenQuellenregister

Originalarbeiterreichbar

Terminal-Bench

github.com (externe Seite)

Das Verzeichnis des Tests, auf dem LangChain seine Harness-Messung gefahren hat. Sagt, was gemessen wird (Aufgaben an der Kommandozeile, vom Übersetzen von Code bis zum Einrichten von Servern) und dass der Test aus zwei Teilen besteht: einer Aufgabensammlung und einer Ausführungsumgebung. Die Rangliste auf tbench.ai führt Modell und Agent als getrennte Spalten und nennt den Anteil gelöster Aufgaben in Prozent; dazu steht hier kein Zitat, weil jene Seite ihre Tabelle nachlädt und der Prüflauf sie nicht liest.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:

  • Terminal-Bench is the benchmark for testing AI agents in real terminal environmentsbestätigt 24.09.2026
  • From compiling code to training models and setting up servers, Terminal-Bench evaluates how well agents can handle real-world, end-to-end tasksbestätigt 24.09.2026
  • Terminal-Bench consists of two parts: a dataset of tasks, and an execution harness that connects a language model to our terminal sandboxbestätigt 24.09.2026

derzeit nirgends verwendet

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.