Originalarbeiterreichbar
Terminal-Bench
Das Verzeichnis des Tests, auf dem LangChain seine Harness-Messung gefahren hat. Sagt, was gemessen wird (Aufgaben an der Kommandozeile, vom Übersetzen von Code bis zum Einrichten von Servern) und dass der Test aus zwei Teilen besteht: einer Aufgabensammlung und einer Ausführungsumgebung. Die Rangliste auf tbench.ai führt Modell und Agent als getrennte Spalten und nennt den Anteil gelöster Aufgaben in Prozent; dazu steht hier kein Zitat, weil jene Seite ihre Tabelle nachlädt und der Prüflauf sie nicht liest.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
Terminal-Bench is the benchmark for testing AI agents in real terminal environments
bestätigt 24.09.2026From compiling code to training models and setting up servers, Terminal-Bench evaluates how well agents can handle real-world, end-to-end tasks
bestätigt 24.09.2026Terminal-Bench consists of two parts: a dataset of tasks, and an execution harness that connects a language model to our terminal sandbox
bestätigt 24.09.2026
derzeit nirgends verwendet