Originalarbeiterreichbar
Measuring short-form factuality in large language models
Jason Wei und weitere, OpenAI, 07.11.2024. Die Arbeit hinter dem Prüfsatz SimpleQA, 4.326 Fragen mit kurzer, eindeutiger Antwort. Wichtig ist hier weniger der Prüfsatz als seine Bewertung: Sie kennt drei Ausgänge statt zwei, richtig, falsch und nicht versucht. Damit wird Enthaltung überhaupt erst ein eigenes Ergebnis und verschwindet nicht in der Fehlerspalte.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 30.07.2026:
SimpleQA is a simple, targeted evaluation for whether models
bestätigt 24.09.2026