Originalarbeiterreichbar
Lessons from the Trenches on Reproducible Evaluation of Language Models
Biderman, Schoelkopf und 29 weitere Mitautoren schreiben auf, was drei Jahre Betrieb der verbreiteten Messvorrichtung lm-eval gelehrt haben. Der Text ist die Belegstelle dafür, dass eine Punktzahl auch vom Messaufbau abhängt und dass vieles daran als stilles Handwerkswissen weitergegeben wird statt dokumentiert zu sein.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 29.08.2026:
Reliable evaluation of language models (LMs) remains an open challenge
bestätigt 24.09.2026the sensitivity of models to evaluation setup
bestätigt 24.09.2026the lack of reproducibility and transparency
bestätigt 24.09.2026attempt to codify much of the tacit or folk knowledge surrounding LM evaluation
bestätigt 24.09.2026