Dokumentationerreichbar
llama.cpp, Dokumentation zum Speculative Decoding
Der Stand vom 17.08.2026, festgehalten über den Commit, weil diese Datei sich schnell ändert. Sie führt elf Verfahren auf, von denen fünf ohne ein zweites Modell auskommen und ihre Vorschläge aus dem schon geschriebenen Text ziehen. Für jedes Verfahren steht ein eigener Abschnitt da, für die Vorhersage mehrerer Token nur eine Tabellenzeile. Der Abschnitt zur Ziehung nennt außerdem die Bedingung, unter der zwei Läufe wirklich dasselbe ergeben.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 19.08.2026:
An implementation with draft model can be mixed with an implementation without draft model
bestätigt 24.09.2026They require no additional model but rely on patterns that have already appeared in the generated text
bestätigt 24.09.2026Use Multi Token Prediction (MTP) heads from the main model
bestätigt 24.09.2026Use greedy sampling when exact output matching is required
bestätigt 24.09.2026
Elf Wege, ein lokales Modell schneller zu machenMulti-Token Prediction im GlossarSpeculative Decoding im Glossar