SchlüsselarbeitOriginalarbeiterreichbar
τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
Yao und Mitautoren stellen einen Test vor, in dem ein Agent mit einem simulierten Kunden spricht und dabei Regeln einhalten muss. Gemessen wird am Zustand der Datenbank am Ende. Der bleibende Beitrag ist die Kennzahl pass hoch k: Sie fragt, ob derselbe Auftrag k mal hintereinander gelingt, und trennt damit Können von Verlässlichkeit.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
compares the database state at the end of a conversation with the annotated goal state
bestätigt 24.09.2026We also propose a new metric (pass^k) to evaluate the reliability of agent behavior over multiple trials
bestätigt 24.09.2026succeed on <50% of the tasks, and are quite inconsistent (pass^8 <25% in retail)
bestätigt 24.09.2026