Zum Hauptinhalt springen
Illustration: Eine Frau in weißer Kleidung bedient ein kleines Gerät, aus dem leuchtende Kugeln, Würfel und Symbole zu einem türkis beleuchteten Tor schweben.
Journal

ANORA Journal

KI-Wissen 08.10.2026 6 Min. Lesezeit N.O.A.H. · Über die Redaktion

Speculative Decoding: Das kleine Modell darf raten

Das Draft-Modell entwirft mehrere Token. Das Zielmodell prüft den Block und verwirft ihn ab dem ersten Widerspruch. So entsteht Tempo, ohne die maßgebliche Verteilung abzugeben.

Im ArtikelInhaltsverzeichnis 6 Kapitel

Jedes Token wartet auf das vorherige

Ein Sprachmodell kann einen Absatz scheinbar in einem Zug schreiben. Technisch entsteht er Schritt für Schritt. Das Modell wählt ein Token, hängt es an den bisherigen Text und berechnet erst dann das nächste. Jede neue Position hängt von der bereits erzeugten Folge ab.

Bei dieser autoregressiven Erzeugung erfordern viele neue Token entsprechend viele serielle Durchläufe. Das wird zur Engstelle, wenn ein großes Modell seine Gewichte für jeden einzelnen Schritt erneut durchlaufen muss.

Speculative Decoding setzt genau dort an. Das Verfahren versucht nicht, das Zielmodell klüger oder kleiner zu machen. Es organisiert einen Teil seiner Inferenz anders: Ein schnelles Draft-Modell bereitet mehrere mögliche nächste Token vor, damit das große Modell sie gemeinsam prüfen kann. Die grundlegende Arbeit von 2023 beschreibt das Verfahren als Möglichkeit, mehrere Positionen parallel zu berechnen, ohne die Ausgabeverteilung des Zielmodells zu verändern. Fast Inference from Transformers via Speculative Decoding ↗

Das geschieht während der Ausgabe. Weder ein neues Training noch eine veränderte Architektur des Zielmodells ist für die klassische Form zwingend erforderlich. Wie sich diese Phase vom Training unterscheidet, erklärt der Grundlagenbeitrag Training und Inferenz: Die zwei Leben eines KI-Modells.

Der Entwurf kommt vom Draft-Modell

Das kleine Draft-Modell erzeugt mehrere Kandidaten hintereinander. Auch für dieses Modell bleibt die Aufgabe zunächst autoregressiv: Jeder seiner Vorschläge baut auf dem vorigen auf. Weil das Modell kleiner und schneller ist, kostet dieser Entwurf jedoch weniger als dieselbe Folge im Zielmodell.

Danach erhält das große Zielmodell den bisherigen Kontext und den vollständigen Kandidatenblock. Es kennt damit bereits die Token, deren Positionen es bewerten soll. In einem gemeinsamen Durchlauf kann es die Wahrscheinlichkeitsverteilungen für sämtliche vorgeschlagenen Stellen und eine zusätzliche Folgestelle berechnen. Die kausale Maske bleibt dabei erhalten: Jede Position darf weiterhin nur den vorherigen Kontext berücksichtigen.

Hier endet die hilfreiche Metapher vom kleinen Assistenten, der einen Text vorschreibt. Das Zielmodell liest keinen fertigen Entwurf und fällt kein menschliches Qualitätsurteil. Es berechnet für jede Position, wie seine eigene Tokenverteilung dort aussehen würde. Der Kandidatenblock macht eine Folge künftiger Positionen vorübergehend gemeinsam prüfbar.

Der Geschwindigkeitsgewinn entsteht also nicht, weil das kleine Modell die Entscheidung günstiger übernimmt. Er entsteht, weil seine Vorschläge dem großen Modell ersparen können, jeden akzeptierten Schritt einzeln vorzubereiten.

Token-Verifikation ist kein Faktencheck

Die klassische, exakte Variante verwendet eine probabilistische Akzeptanzregel. Für ein vorgeschlagenes Token steht q für die Wahrscheinlichkeit des Draft-Modells und p für die Wahrscheinlichkeit des Zielmodells. Das Token wird mit der Wahrscheinlichkeit min(1, p/q) akzeptiert. Bewertet das Zielmodell den Kandidaten mindestens so hoch wie das Draft-Modell, wird er sicher übernommen.

Illustration: Eine illustrierte Frau im weißen Blazer betrachtet eine farbige Förderbandanlage mit runden Plättchen; unten rechts steht ein Logo mit „anora AI Business OS“.
Eine illustrierte Frau im weißen Blazer betrachtet eine farbige Förderbandanlage mit runden Plättchen; unten rechts steht ein Logo mit „anora AI Business OS“. KI-generierte Illustration.

Lehnt das Verfahren einen Kandidaten ab, kann es nicht einfach das wahrscheinlichste Token des Zielmodells einsetzen. Das würde die resultierende Verteilung verändern. Stattdessen wird ein Ersatz aus einer korrigierten Verteilung gezogen, die dem normalisierten positiven Rest von p − q entspricht. Alle späteren Draft-Token werden verworfen, weil sie auf einem Präfix beruhen, das nun nicht mehr gilt.

Werden dagegen sämtliche Kandidaten akzeptiert, kann der gemeinsame Durchlauf noch ein zusätzliches Token aus der Verteilung des Zielmodells liefern. Eine Runde erzeugt deshalb mindestens ein gültiges Token und im günstigen Fall den vollständigen akzeptierten Block plus ein weiteres.

Diese Rejection-Sampling-Mechanik erhält bei exakter Ausführung die vorgesehene Ausgabeverteilung des Zielmodells. Das Draft-Modell darf häufig falschliegen, ohne eine eigene Verteilung durchzusetzen. Seine Fehler können Rechenzeit kosten. Autorität über die gültige Ausgabe erhalten sie nicht. Algorithmus und Herleitung stehen in der veröffentlichten ICML-Fassung ↗.

Gleiche Verteilung bedeutet nicht garantiert denselben Wortlaut. Bei stochastischer Ausgabe können zwei unabhängige Läufe ohnehin verschiedene Stichproben ziehen. Hinzu kommen in realen Inferenzsystemen numerische Abweichungen durch parallele Rechenkerne und Gleitkommaoperationen. Die Garantie des Algorithmus betrifft die Wahrscheinlichkeitsverteilung unter seinen Annahmen, nicht die buchstabengetreue Wiederholung jedes Laufs.

Ein Satz läuft bis zum ersten Widerspruch

Vereinfachtes Beispiel: Ein Modell soll den Satz „Die Plattform verbindet“ fortsetzen. Zur besseren Lesbarkeit behandeln wir die Kandidaten als Wörter, obwohl reale Token auch Wortteile oder Satzzeichen sein können.

Das Draft-Modell schlägt vor: „SEO, Content und Kampagnen in einem System“. Das Zielmodell berechnet nun in einem Durchlauf seine Verteilungen für die Positionen, an denen diese Kandidaten stehen sollen.

Die Akzeptanzregel übernimmt zunächst „SEO“, dann „Content“ und „und“. Beim Kandidaten „Kampagnen“ kommt es zur Ablehnung. Das Verfahren zieht an dieser Stelle ein korrigiertes Token aus der Verteilung des Zielmodells. Die verbleibenden Kandidaten „in einem System“ werden nicht mehr geprüft oder nachträglich angehängt. Ihr Kontext enthielt das abgelehnte Token und ist damit ungültig geworden.

Das Zielmodell musste den akzeptierten Anfang nicht in getrennten seriellen Schritten erzeugen. Trotzdem stammt die gültige Folge weiterhin aus seiner Verteilung. Das Draft-Modell hat einen möglichen Weg vorgezeichnet. Beschlossen hat es ihn nicht.

Eine hohe Akzeptanzrate reicht nicht

Wie stark sich damit eine LLM-Inferenz beschleunigen lässt, hängt zunächst von der Akzeptanzrate ab. Je ähnlicher die Verteilungen beider Modelle an den vorgeschlagenen Stellen sind, desto länger ist im Mittel der übernommene Anfang. Doch diese Übereinstimmung ist nur eine Seite der Rechnung.

Ein sehr schwaches Draft-Modell produziert günstig, aber womöglich viele unbrauchbare Kandidaten. Ein größeres Draft-Modell erzielt eventuell eine bessere Akzeptanzrate, verbraucht jedoch selbst mehr Zeit. Auch die Blocklänge besitzt einen Wendepunkt: Wird früh abgelehnt, war die Berechnung aller späteren Vorschläge vergeblich.

Die ICML-Grundlagenarbeit berichtete für ihre T5-XXL-Konfiguration eine zwei- bis dreifache Beschleunigung gegenüber der verwendeten T5X-Implementierung. Das ist ein Ergebnis dieses Versuchsaufbaus, kein allgemeiner Faktor für beliebige Modelle und Hardware. Eine Studie von 2024 fand in ihren Experimenten geeignete Draft-Modelle, die etwa zehn- bis zwanzigmal kleiner als das Zielmodell waren, sowie günstige Blocklängen von drei bis fünf Token. Auch diese Werte beschreiben untersuchte Konfigurationen und keine universelle Bauanleitung. How Speculative Can Speculative Decoding Be? ↗

Eine in den MLSys-Proceedings 2026 veröffentlichte Untersuchung auf vLLM zeigt, warum solche Einzelwerte vorsichtig zu lesen sind. In den getesteten Aufbauten nahm der relative Vorteil mit wachsender Batch-Größe ab. Die Verifikation durch das Zielmodell beanspruchte je nach Methode und Konfiguration zwischen 42 und 95 Prozent der Ausführungszeit. Der MLSys-Beitrag dokumentiert den Konferenzstatus ↗; die am 18. März 2026 revidierte Fassung ↗ enthält die ausführlichen Messungen.

Wer den praktischen Nutzen bewerten will, braucht deshalb mehr als eine Akzeptanzrate. Zeit bis zum ersten Token, Abstand zwischen den folgenden Token, Gesamtlatenz und Durchsatz unter paralleler Last beschreiben verschiedene Eigenschaften. Relevant ist nicht der höchste isolierte Beschleunigungsfaktor, sondern das Verhalten mit dem vorgesehenen Modellpaar, der tatsächlichen Hardware und repräsentativen Ausgaben.

Nützlich, weil es nicht entscheiden muss

Speculative Decoding delegiert die Qualität der Ausgabe nicht an ein schwächeres Modell. Das Draft-Modell darf schnell, unvollkommen und gelegentlich falsch sein. Seine Aufgabe ist enger: Es soll genügend plausible Zukunft liefern, damit das Zielmodell mehrere Positionen gemeinsam bewerten kann.

Darin liegt die eigentliche Idee. Das Verfahren versucht nicht, Vermutungen zu vermeiden. Es macht sie billig und ihre Prüfung parallel. Sobald ein Vorschlag nicht mehr zur Verteilung des Zielmodells passt, endet seine Gültigkeit.

Das kleine Modell beschleunigt die Antwort daher nicht, obwohl es irren kann. Es beschleunigt sie, weil sein Irrtum folgenlos bleiben darf. Entscheidend ist nicht, wer den ersten Vorschlag macht, sondern wessen Verteilung am Ende gilt.

Einordnung

N.O.A.H. Insights

Zusätzliche Signale und Schlussfolgerungen aus dem Beitrag.

MechanikDas Draft-Modell erzeugt Kandidaten seriell. Das Zielmodell bewertet ihre Positionen gemeinsam und übernimmt nur den längsten akzeptierten Anfang.

BegriffsgrenzeToken-Verifikation ist weder Faktencheck noch semantisches Qualitätsurteil. Sie prüft die probabilistische Vereinbarkeit des Vorschlags mit dem Zielmodell.

LeistungsgrenzeEine hohe Akzeptanzrate allein beweist keinen Geschwindigkeitsgewinn. Entscheidend ist, ob die eingesparten seriellen Durchläufe die Kosten für Entwurf und Verifikation übersteigen.

FAQ

Häufige Fragen

Kurze Antworten auf die wichtigsten Fragen zum Beitrag.

Verändert Speculative Decoding die Qualität der Antwort?

Das klassische exakte Verfahren ist so konstruiert, dass die Ausgabeverteilung des Zielmodells erhalten bleibt. Das garantiert jedoch keinen identischen Wortlaut bei unabhängig wiederholten Läufen. Numerische Effekte realer Inferenzsysteme können zusätzliche Abweichungen verursachen.

Müssen Draft-Modell und Zielmodell dieselbe Architektur haben?

Nein. Für die klassische modellbasierte Variante müssen ihre Tokenräume und Wahrscheinlichkeiten jedoch so kompatibel sein, dass die vorgeschlagenen Token mit den Verteilungen des Zielmodells verglichen werden können.

Was geschieht, wenn alle vorgeschlagenen Token akzeptiert werden?

Dann kann das Verfahren den vollständigen Draft-Block übernehmen und zusätzlich ein weiteres Token aus der bereits berechneten Verteilung des Zielmodells erzeugen.

Wann lohnt sich Speculative Decoding nicht?

Der Vorteil kann verschwinden, wenn das Draft-Modell zu teuer ist, Vorschläge häufig abgelehnt werden, Blöcke ungünstig lang sind oder hohe parallele Last das System bereits rechengebunden macht.

Zum Nachlesen

Quellen zum Beitrag

Diese Referenzen werden im Artikel verlinkt. Maßgeblich sind die jeweilige Aussage, ihr Kontext und der Stand der Quelle.

Aus Erkenntnis wird Umsetzung

Bringen Sie KI aus der Theorie in Ihren Arbeitsalltag.

Sehen Sie, wie ANORA Wissen, Modelle, klare Zuständigkeiten und Freigaben in einen kontrollierten Workflow für Ihr Unternehmen übersetzt.

KI-Workflow mit ANORA prüfen