NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

arxiv.org (externe Seite)

Yao und Mitautoren stellen einen Test vor, in dem ein Agent mit einem simulierten Kunden spricht und dabei Regeln einhalten muss. Gemessen wird am Zustand der Datenbank am Ende. Der bleibende Beitrag ist die Kennzahl pass hoch k: Sie fragt, ob derselbe Auftrag k mal hintereinander gelingt, und trennt damit Können von Verlässlichkeit.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:

  • compares the database state at the end of a conversation with the annotated goal statebestätigt 24.09.2026
  • We also propose a new metric (pass^k) to evaluate the reliability of agent behavior over multiple trialsbestätigt 24.09.2026
  • succeed on <50% of the tasks, and are quite inconsistent (pass^8 <25% in retail)bestätigt 24.09.2026

03 Chancen und Grenzen04 Was eine Benchmarkzahl sagt

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.