NachschlagenQuellenregister

Originalarbeiterreichbar

MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark

arxiv.org (externe Seite)

Wang und Mitautoren bauen den verbreiteten Wissenstest MMLU um, weil die Spitzenmodelle darin dicht beieinanderlagen und der Test damit aufgehört hatte, sie zu unterscheiden. Vier Antwortmöglichkeiten werden zu zehn, triviale Fragen fliegen heraus. Der Beleg für zwei Sachen zugleich: dass ein Test durch Erfolg unbrauchbar wird, und wie stark eine Punktzahl allein von der Formulierung der Aufgabe abhängt.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:

  • their performance on these benchmarks has begun to plateau, making it increasingly difficult to discern differences in model capabilitiesbestätigt 24.09.2026
  • causing a significant drop in accuracy by 16% to 33% compared to MMLUbestätigt 24.09.2026
  • the sensitivity of model scores to prompt variations decreased from 4-5% in MMLU to just 2% in MMLU-Probestätigt 24.09.2026
  • expanding the choice set from four to ten optionsbestätigt 24.09.2026

Massive Multitask Language Understanding im Glossar04 Was eine Benchmarkzahl sagt

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.