Artikelerreichbar
Defeating Nondeterminism in LLM Inference
thinkingmachines.ai (externe Seite)
Die Untersuchung, die den verbreiteten Verdacht ausräumt, die Parallelität der Grafikkarte mische die Rechenreihenfolge auf. Der einzelne Rechenschritt ist wiederholbar, der Unterschied entsteht eine Ebene höher: Ein Schritt liefert je nach Größe des Stapels, in dem er mitläuft, leicht verschiedene Zahlen, und die Stapelgröße hängt an den fremden Anfragen im selben Moment. Gemessen an einem offenen Modell bei Temperatur 0 und tausend Token je Antwort: achtzig verschiedene Ergebnisse aus tausend Läufen, alle gleich bis zum 102. Token. Zu lesen ist der Text mit einer Einschränkung, die er selbst nennt: Die Lösung, mit der danach alle tausend Läufe gleich ausfallen, stammt von denselben Autoren.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
causing our request’s output to depend on the batch size of our forward pass
bestätigt 24.09.2026Even when running inference on your own hardware with an OSS inference library like vLLM or SGLang, sampling still isn’t deterministic
bestätigt 24.09.2026