ANORA Journal
Warum die Reihenfolge identischer Prompt-Beispiele zählt
Ein Sprachmodell liest Beispiele nicht als ungeordnete Sammlung, sondern als gerichtete Tokenfolge. Das erklärt Reihenfolgeeffekte – und verlangt getrennte Tests auf Korrektheit und Stabilität.
Im ArtikelInhaltsverzeichnis 7 Kapitel
Drei Beispiele ergeben sechs Eingaben
Aus drei Beispielen lassen sich sechs Reihenfolgen bilden, ohne dass ein Fakt hinzukommt oder verschwindet. Ein Mensch kann alle sechs Varianten als dieselbe kleine Beispielsammlung lesen. Ein Sprachmodell erhält sechs verschiedene Tokenfolgen.
Damit ist die kurze Antwort bereits gegeben: Reihenfolge ist für ein Sprachmodell kein Layout. Tauschen Beispiele ihre Plätze, ändern sich ihre absoluten Positionen, ihre Vorgänger und die Kontexte, unter denen ihre Tokens verarbeitet werden. Das Modell kann deshalb eine andere Fortsetzung für wahrscheinlicher halten.
Solche Beispiele im Prompt werden beim In-Context Learning verwendet. Das Modell erhält einige Demonstrationen und soll das darin erkennbare Muster auf eine neue Anfrage übertragen, ohne dass seine Gewichte für diese einzelne Aufgabe angepasst werden. Diese Praxis wird häufig auch als Few-Shot Prompting bezeichnet.
Der Effekt ist von schwankenden Ausgaben bei einem vollkommen identischen Prompt zu trennen. Beim Umsortieren hat sich die Eingabe selbst verändert. Weshalb selbst Temperatur 0 keine absolute Wiederholbarkeit garantiert, erklärt der Beitrag Temperatur 0: Warum sich die Antwort trotzdem verändert.
Die Maske macht aus Reihenfolge eine Richtung
In einem kausalen Sprachmodell darf ein Token auf frühere und auf seine eigene Position zugreifen, nicht aber auf spätere Tokens. Diese Einschränkung heißt kausale Aufmerksamkeitsmaske. Sie verhindert, dass das Modell beim Berechnen einer Position Informationen aus der Zukunft der Sequenz verwendet.
Für Prompt-Beispiele hat das eine konkrete Folge. Das erste Beispiel kann in seiner internen Repräsentation keine späteren Beispiele berücksichtigen. Ein Beispiel weiter hinten kann dagegen Informationen aus den vorherigen Demonstrationen verarbeiten. Werden die Beispiele vertauscht, wechseln daher nicht nur ihre Plätze. Auch die Kontexte, aus denen ihre Repräsentationen entstehen, sind andere.
Die abschließende Anfrage kann zwar auf alle vorherigen Beispiele zugreifen. Sie greift dabei jedoch auf Repräsentationen zu, die unter unterschiedlichen Informationsbedingungen gebildet wurden. Die Tokenfolge bestimmt somit nicht nur, was vorhanden ist, sondern auch, auf welchem gerichteten Weg es in die Berechnung eingeht.
Eine ACL-Arbeit von 2024 zur Reihenfolgeempfindlichkeit kausaler Sprachmodelle ↗ verglich kausale Modelle mit Prefix-Modellen, die innerhalb des Eingabebereichs umfassender auf andere Positionen zugreifen können. In den untersuchten Aufgaben reagierten die kausalen Modelle stärker auf vertauschte Demonstrationen. Die Autoren führen dies auf die positionsabhängigen rezeptiven Felder zurück. Sie formulieren diese Erklärung als begründeten Mechanismusvorschlag, nicht als vollständige Ursache jedes Reihenfolgeeffekts.
Die Maske ist deshalb ein wichtiger Teil der Erklärung, aber keine Universalformel. Auch Positionsverarbeitung, Ähnlichkeit zur Anfrage, Promptformat und das Zusammenspiel der Beispiele können beeinflussen, welche Demonstration Gewicht erhält. Eine vertiefende Einführung in die Transformer-Architektur bietet Das fremde Verstehen: Wie Transformer Sprache berechnen.
Ein Grenzfall zwischen zwei Kategorien
Konstruiertes Beispiel, kein dokumentierter Modelltest: Ein System soll operative Meldungen entweder als „sofort prüfen“ oder als „regulär prüfen“ einordnen. Der Prompt enthält drei Demonstrationen:
- Der Checkout ist für alle Kunden ausgefallen, ein Ersatzweg fehlt: sofort prüfen.
- Am Monatsende funktioniert der Rechnungsexport nicht, ein Ersatzweg fehlt: sofort prüfen.
- Der Wochenbericht ist verspätet, ein manueller Export ist möglich: regulär prüfen.
Die neue Meldung lautet: Der Kampagnenbericht ist vor einem Kundentermin nicht verfügbar. Ein manueller Export wäre möglich, würde aber mehrere Stunden dauern.
Der Fall trägt Merkmale beider Kategorien. Ein Ersatzweg ist vorhanden, wie beim regulären Beispiel. Zugleich entsteht eine unmittelbare zeitliche Konsequenz, die an die dringenden Fälle erinnert.
Nun wird nur die Reihenfolge der Demonstrationen verändert. In einer Variante steht der verspätete Wochenbericht direkt vor der Anfrage. In einer anderen endet die Reihe mit dem ausgefallenen Rechnungsexport. Das Modell muss seine Entscheidung nicht wechseln. Es kann aber, weil die Beispiele nun andere Positionen und vorausgehende Kontexte besitzen.
Die einfache Erklärung „Das letzte Beispiel gewinnt“ wäre zu grob. Nähe zur Anfrage kann eine Rolle spielen, ist aber keine verlässliche Regel. Je nach Modell, Aufgabe und Promptstruktur kann eine andere Position günstiger sein. Das Beispiel zeigt daher nicht die beste Reihenfolge. Es zeigt die Variable, die geprüft werden muss.
Positionsbias ist mehr als ein vertauschtes Beispiel
Reihenfolgeempfindlichkeit und Positionsbias bei LLMs sind verwandt, aber nicht identisch. Ein Permutationstest vertauscht einzelne Demonstrationen innerhalb eines ansonsten konstanten Prompts. Positionsstudien können dagegen ganze Blöcke verschieben, etwa die Demonstrationen relativ zur Systemanweisung oder zur eigentlichen Nutzerfrage.
Eine EMNLP-Studie von 2025 zur Position von Demonstrationen ↗ untersuchte zehn offene Modelle aus vier Modellfamilien über Klassifikation, Fragenbeantwortung, Zusammenfassung und Schlussfolgerungsaufgaben hinweg. Vorhersagen und Genauigkeit veränderten sich, wenn Demonstrationen an andere Stellen des Prompts rückten. Kleinere Modelle reagierten in den Versuchen stärker; auch größere Modelle blieben bei komplexeren Aufgaben teilweise empfindlich.
Dieser Befund stützt keine allgemeine Vorschrift wie „Wichtiges immer zuerst“. Die Studie untersucht eine bestimmte Form der Blockplatzierung. Die interne Reihenfolge mehrerer Beispiele ist eine angrenzende, aber eigenständige Frage. Aus dem Mittelwert einer Versuchsanordnung wird keine sichere Promptregel für jedes Modell.
Eine stabile Antwort kann stabil falsch sein
Mehrere Antworten für dieselbe Anordnung zu erzeugen und anschließend die Mehrheit zu wählen, prüft zunächst die Schwankung zwischen Läufen. Die Reihenfolge bleibt dabei unverändert. Ein systematischer Positionseffekt kann deshalb in jeder Stichprobe erneut auftreten.
Eine TACL-Arbeit von 2026 zu Self-Consistency in langen Kontexten ↗ berichtet für die untersuchten Modelle und Aufgaben sogar eine Verschlechterung: Wiederholtes Sampling verstärkte dort bestehende Positionsfehler. Das Ergebnis betrifft Langkontext-Szenarien und darf nicht auf jede Mehrfachabfrage übertragen werden. Es zeigt jedoch, weshalb eine Mehrheitsentscheidung allein keinen Test auf Reihenfolgestabilität ersetzt.
Umgekehrt beweist eine gleichbleibende Antwort noch keine Qualität. Eine ACL-Arbeit von 2026 zur gezielten Verringerung von Reihenfolgeempfindlichkeit ↗ beschreibt ein Trainingsverfahren, das Stabilität und Korrektheit gemeinsam optimieren soll. Die Autoren benennen dabei ein entscheidendes Gegenproblem: Ein Modell kann über mehrere Anordnungen hinweg konsistent und dennoch falsch antworten.
So testen Sie Reihenfolge statt Intuition
Ein belastbarer Test sucht nicht nach dem schönsten Prompt. Er prüft, ob fachlich richtige Entscheidungen unter inhaltlich gleichwertigen Anordnungen bestehen bleiben.
- Prüfbare Referenzfälle wählen. Verwenden Sie Aufgaben mit fachlich feststellbarem Ergebnis. Neben klaren Fällen gehören Grenzfälle in den Test, weil sich Reihenfolgeeffekte dort eher in unterschiedliche Entscheidungen übersetzen können.
- Nur die Demonstrationen vertauschen. Anweisung, Labels, Trennzeichen, Anfrage und Ausgabeformat bleiben konstant. Bei drei unterschiedlichen Beispielen können alle sechs Reihenfolgen geprüft werden. Bei größeren Sets genügt eine vorab definierte Auswahl von Permutationen.
- Die Laufbedingungen festhalten. Dokumentieren Sie Modell und Version, Systemanweisung, Sampling-Einstellungen, Werkzeuge und abgerufene Dokumente. Sonst lässt sich eine Abweichung nicht eindeutig der Reihenfolge zuordnen.
- Korrektheit und Stabilität getrennt messen. Bei Klassifikationen lässt sich erfassen, wie oft die richtige Kategorie erscheint und wie häufig die Kategorie zwischen Permutationen wechselt. Bei freier Textausgabe sollte die fachliche Entscheidung bewertet werden, nicht jede sprachliche Variation.
- Die Konsequenz des Fehlers berücksichtigen. Eine wechselnde redaktionelle Kategorie lässt sich möglicherweise vor Veröffentlichung korrigieren. Eine wechselnde Budget-, Freigabe- oder Ausführungsentscheidung verlangt eine engere Absicherung.
Die Beispiele müssen dabei tatsächlich unabhängig sein. Verweist ein Fall auf „das vorherige Beispiel“, erzählt die Reihe eine Chronologie oder baut eine Regel schrittweise auf, verändert das Umsortieren die Bedeutung. Ein sauberer Permutationstest verwendet eigenständige Demonstrationen ohne versteckte Abhängigkeiten.
Zeigt sich eine relevante Empfindlichkeit, können klarere Kriterien, eindeutigere Labels oder weniger mehrdeutige Demonstrationen helfen. Mitunter trägt ein anderes Modell oder ein speziell trainiertes Verfahren. Welche Änderung wirkt, zeigt erst der nächste Test. Die bloße Vermutung, eine bestimmte Position sei grundsätzlich sicher, reicht nicht.
Ein Prompt ist keine Schachtel für Fakten
Menschen können Beispiele gedanklich aus ihrer Reihenfolge lösen und als Menge betrachten. Ein Sprachmodell erhält keine Menge. Es erhält eine geordnete Folge, deren Positionen und gerichtete Informationswege Teil der Berechnung sind.
Die entscheidende Frage lautet deshalb nicht nur: Hat das Modell alle relevanten Fakten bekommen? Sondern: Bleibt seine Entscheidung richtig, wenn dieselben Fakten ihre Plätze tauschen?
N.O.A.H. Insights
Zusätzliche Signale und Schlussfolgerungen aus dem Beitrag.
Technische KernideeDie abschließende Anfrage kann alle vorherigen Beispiele berücksichtigen. Deren interne Repräsentationen wurden jedoch unter unterschiedlichen kausalen Informationsbedingungen gebildet.
Begriffliche TrennungEin Reihenfolgeeffekt entsteht durch das Vertauschen von Elementen. Positionsbias bezeichnet allgemeiner die ungleiche Nutzung verschiedener Bereiche eines Kontexts.
PrüfregelEine konsistente Antwort ist nicht automatisch richtig. Deshalb müssen Reihenfolgestabilität und fachliche Korrektheit als zwei eigene Messgrößen behandelt werden.
Häufige Fragen
Kurze Antworten auf die wichtigsten Fragen zum Beitrag.
Sollten die wichtigsten Beispiele immer am Anfang des Prompts stehen?
Nein. Welche Position günstig ist, hängt von Modell, Aufgabe, Promptstruktur und Kontext ab. Eine feste Platzierungsregel ersetzt keinen Test mit mehreren inhaltlich gleichwertigen Reihenfolgen.
Verhindert Temperatur 0 den Reihenfolgeeffekt?
Nein. Temperatur 0 kann die Auswahl des nächsten Tokens stärker festlegen. Zwei unterschiedlich sortierte Prompts bleiben dennoch unterschiedliche Eingaben.
Sind größere Sprachmodelle automatisch reihenfolgestabil?
Nein. Größere Modelle können in manchen Versuchen weniger empfindlich reagieren. Auch sie können bei komplexen Aufgaben oder langen Eingaben Positions- und Reihenfolgeeffekte zeigen.
Quellen zum Beitrag
Diese Referenzen werden im Artikel verlinkt. Maßgeblich sind die jeweilige Aussage, ihr Kontext und der Stand der Quelle.
Bringen Sie KI aus der Theorie in Ihren Arbeitsalltag.
Sehen Sie, wie ANORA Wissen, Modelle, klare Zuständigkeiten und Freigaben in einen kontrollierten Workflow für Ihr Unternehmen übersetzt.
KI-Workflow mit ANORA prüfen