Ankündigung des Herstellerserreichbar
Why language models hallucinate
OpenAIs eigene Darstellung der Arbeit vom Vortag, 05.09.2025. Sie enthält den Vergleich mit dem Multiple-Choice-Bogen und die Tabelle, die zeigt, was Enthaltung kostet: Ein Modell, das bei jeder zweiten Frage schweigt, kommt auf 26 Prozent Falschauskunft, eines, das fast immer antwortet, auf 75 Prozent, bei fast gleicher Trefferquote. Beleg auch für die Gegenthese zur behaupteten Unvermeidbarkeit.
geprüft 24.09.2026Archivfassung (externe Seite, web.archive.org)
Worauf sich diese Seite beruft, wörtlich, abgerufen am 30.07.2026:
Leaving it blank guarantees a zero
bestätigt 24.09.2026accuracy-only scoreboards dominate leaderboards and model cards
bestätigt 24.09.2026because language models can abstain when uncertain
bestätigt 24.09.2026the older OpenAI o4-mini model performs slightly better
bestätigt 24.09.2026a good hallucination eval has little effect against hundreds of traditional accuracy-based evals
bestätigt 24.09.2026