Originalarbeiterreichbar
Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
Die Gegenprobe zu der Annahme, mehrere Modelle als Prüfer ergäben mehrere Meinungen. Neun starke Modelle aus sieben Familien urteilen über dieselben Aufgaben, und ihre Fehler fallen so oft zusammen, dass von der rechnerischen Unabhängigkeit etwa ein Viertel übrig bleibt. Gemessen wurde an Aufgaben zum Sprachverstehen. Für die Frage, ob zwei Sitzungen desselben Modells einander prüfen können, bleibt das eine Überlegung.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 28.08.2026:
Roughly three-quarters of the panel's nominal independence is lost
bestätigt 24.09.2026scaling up panels cannot substitute for genuinely independent evaluation
bestätigt 24.09.2026
derzeit nirgends verwendet