NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents

arxiv.org (externe Seite)

Die Gegenprobe zu der Annahme, ein Agent werde besser, wenn er mehr Tests schreibt. Sechs Modelle auf SWE-bench Verified, dazu ein Versuch, in dem der Auftrag gezielt zu mehr oder weniger Tests drängt. Gelöste und ungelöste Aufgaben desselben Modells schreiben ähnlich viele Tests, und die Menge ändert am Ergebnis nichts. Der Grund steht daneben und erklärt den scheinbaren Widerspruch zu allem anderen: Was der Agent von sich aus schreibt, sind überwiegend Ausgaben zur Beobachtung und selten Prüfungen mit einer Zusicherung.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 28.08.2026:

  • agents often write tests on the fly, but the value of this behavior remains unclearbestätigt 24.09.2026
  • resolved and unresolved tasks within the same model exhibit similar test-writing frequenciesbestätigt 24.09.2026
  • they mainly serve as observational feedback channels, with value-revealing print statements appearing much more often than assertion-based checksbestätigt 24.09.2026
  • prompt-induced changes in the volume of agent-written tests do not significantly change final outcomes in this settingbestätigt 24.09.2026
  • current agent-written testing practices reshape process and cost more than final task outcomesbestätigt 24.09.2026

Erst der rote Test

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.