NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

Measuring AI Ability to Complete Long Software Tasks

arxiv.org (externe Seite)

Kwa, West, Becker und 21 weitere Mitautoren von METR schlagen im März 2025 eine Kennzahl vor, die eine Modellfähigkeit in menschlicher Arbeitszeit ausdrückt: die Aufgabenlänge, die ein Modell mit einer bestimmten Wahrscheinlichkeit schafft. Gemessen wurde an 170 Aufgaben, für die zuerst Fachleute die Bearbeitungszeit lieferten. Die Arbeit nennt ihre eigenen Grenzen ausdrücklich, darunter die Übertragbarkeit auf Arbeit außerhalb der Testreihe.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:

  • we propose a new metric: 50%-task-completion time horizonbestätigt 24.09.2026
  • This is the time humans typically take to complete tasks that AI models can complete with 50% success ratebestätigt 24.09.2026
  • current frontier AI models such as Claude 3.7 Sonnet have a 50% time horizon of around 50 minutesbestätigt 24.09.2026
  • seems to be primarily driven by greater reliability and ability to adapt to mistakesbestätigt 24.09.2026
  • frontier AI time horizon has been doubling approximately every seven months since 2019bestätigt 24.09.2026

03 Chancen und Grenzen05 Geschwindigkeit der Entwicklung

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.