NachschlagenQuellenregister

Artikelerreichbar

Defeating Nondeterminism in LLM Inference

thinkingmachines.ai (externe Seite)

Die Untersuchung, die den verbreiteten Verdacht ausräumt, die Parallelität der Grafikkarte mische die Rechenreihenfolge auf. Der einzelne Rechenschritt ist wiederholbar, der Unterschied entsteht eine Ebene höher: Ein Schritt liefert je nach Größe des Stapels, in dem er mitläuft, leicht verschiedene Zahlen, und die Stapelgröße hängt an den fremden Anfragen im selben Moment. Gemessen an einem offenen Modell bei Temperatur 0 und tausend Token je Antwort: achtzig verschiedene Ergebnisse aus tausend Läufen, alle gleich bis zum 102. Token. Zu lesen ist der Text mit einer Einschränkung, die er selbst nennt: Die Lösung, mit der danach alle tausend Läufe gleich ausfallen, stammt von denselben Autoren.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:

  • causing our request’s output to depend on the batch size of our forward passbestätigt 24.09.2026
  • Even when running inference on your own hardware with an OSS inference library like vLLM or SGLang, sampling still isn’t deterministicbestätigt 24.09.2026

12 Wie zufällig die Antwort ist

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.