Originalarbeiterreichbar
METR, Measuring AI Ability to Complete Long Software Tasks
Die eigene Darstellung der Arbeit vom 19.03.2025. Sie nennt die beiden Werte, die im Abstract fehlen und die den Befund erst greifbar machen: Aufgaben unter vier Minuten gelingen fast immer, Aufgaben über etwa vier Stunden in weniger als zehn Prozent der Fälle.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
current models have almost 100% success rate on tasks taking humans less than 4 minutes, but succeed <10% of the time on tasks taking more than around 4 hours
bestätigt 24.09.2026