ANORA Journal
DeepSeek V4.1-Flash führt in Agententests – Pro bleibt
DeepSeek meldet einen Benchmarkvorsprung für V4.1-Flash. Die neue Architektur ist effizienter, doch die Ergebnisse sind gemischt – und V4-Pro bleibt entgegen der ersten Ankündigung verfügbar.
Im ArtikelInhaltsverzeichnis 6 Kapitel
Flash führt in Agententests. Pro bleibt verfügbar
Am 10. September 2026 veröffentlichte DeepSeek V4.1-Flash über seine API. Der Anbieter stellte das Modell als kleinsten Vertreter einer neuen Architekturfamilie vor und erklärte, es übertreffe in Benchmarks selbst das Flaggschiff V4-Pro. Die operative Konsequenz schien eindeutig: Laut der Launch-Mitteilung vom 10. September ↗ sollten Aufrufe von deepseek-v4-pro ab dem 14. September an V4.1-Flash weitergeleitet werden.
Genau das geschah nicht. Das aktuell abrufbare Änderungsprotokoll von DeepSeek ↗ hält fest, dass V4-Pro wegen der Nachfrage auch nach dem 14. September als eigener API-Dienst verfügbar bleibt. Am 24. September führt die Preisübersicht beide Modelle getrennt auf. Die Meldung hat sich damit in ihrer wichtigsten praktischen Konsequenz verändert.
Unverändert bleiben zwei andere Teile: DeepSeek hat die Architektur deutlich umgebaut. Und V4.1-Flash liegt in mehreren veröffentlichten Agententests vor V4-Pro. Daraus folgt jedoch kein allgemeiner Modellsieg. Die Tabellen zeigen ein Leistungsprofil, keinen eindeutigen Ersatz.
Der neue Rechenweg ist asymmetrisch
Der technische Fortschritt liegt weniger in der Gesamtzahl der Parameter als in der Frage, welche Teile des Modells wann arbeiten. V4.1-Flash nutzt einen Transformer mit 40 Schichten: 20 bilden einen kausalen Encoder, 20 den Decoder. Beim Einlesen eines Prompts, dem sogenannten Prefill, aktiviert das Modell 8 Milliarden Parameter pro Token. Während der Ausgabe sind es 16 Milliarden. Der am 17. September eingereichte technische Bericht von DeepSeek-AI ↗ beschreibt diese Trennung als Causal Encoder-Decoder.
Das passt zu langen Agentenläufen. Sie lesen oft umfangreiche Codebestände, Dokumente, Bilder und frühere Werkzeugergebnisse ein, bevor sie eine vergleichsweise kurze Aktion ausführen. Wenn der Eingabepfad weniger Modellteile aktiviert, sinkt der Rechenaufwand dort, wo solche Abläufe besonders viel Kontext verarbeiten.
Hinzu kommt ein kleinerer KV-Cache. Er bewahrt Zwischenergebnisse früherer Tokens, damit der Kontext während der Ausgabe nicht vollständig neu berechnet werden muss. DeepSeek kombiniert dafür schichtübergreifende Wiederverwendung mit einem Cache in geringerer Präzision. Der globale KV-Cache soll dadurch 890 Byte pro Token belegen – rund ein Viertel des Werts von V4-Flash. Der dauerhaft in SSD oder Hauptspeicher vorzuhaltende Anteil sinkt laut Bericht auf ungefähr ein Achtel. Beide Verhältnisse vergleichen V4.1-Flash mit der vorherigen Flash-Generation, nicht mit V4-Pro.
Der Vorsprung endet an der Benchmarkgrenze
In mehreren Agententests ist der Abstand zu V4-Pro klar. Die offizielle Modellkarte mit den Testbedingungen ↗ nennt für Terminal-Bench 2.1 einen Wert von 90,6 gegenüber 87,9 für V4-Pro. Bei CyberGym stehen 88,1 gegen 83,3, bei Agents’ Last Exam 31,8 gegen 25,7. Auch in DeepSWE, NL2Repo-Bench und mehreren weiteren ausführenden Tests liegt Flash vorn.
Das Bild dreht sich bei anderen Aufgaben. In GPQA Diamond erreicht V4.1-Flash 90,9, V4-Pro 92,4. Auf dem reinen Textteil von Humanity’s Last Exam stehen 39,1 gegen 42,7. Schon die Basismodelle ergeben eine gemischte Tabelle: V4.1-Flash liegt etwa bei MMLU-Pro leicht vorn, bei MultiLoKo und LongBench-V2 dagegen deutlich hinter Pro.
Das ist kein Widerspruch. Ein Modell kann bei Code-Agenten und Werkzeugnutzung zulegen, ohne bei Weltwissen oder langen Textaufgaben überall vorbeizuziehen. Problematisch ist erst die Verdichtung dieser Unterschiede zu einem universellen Urteil.
DeepSeek schreibt auf der Launch-Seite außerdem von Tests „mehrerer Parteien“, die Vorteile bei Leistung, Kosten, Geschwindigkeit und Gesamtlaufzeit gezeigt hätten. Diese Parteien werden dort nicht benannt; zugehörige Prüfprotokolle sind nicht verlinkt. Die Modellkarte dokumentiert zwar Einstellungen und stellt für DeepSWE Reproduktionshinweise bereit. Eine unabhängige Bestätigung sämtlicher Vergleichswerte ist das noch nicht. Der behauptete Vorsprung bleibt daher eine Anbieterbewertung mit nachvollziehbaren Teilbelegen.
Offene Gewichte machen das Modell nicht klein
DeepSeek veröffentlicht die Gewichte unter MIT-Lizenz. Damit ist V4.1-Flash ein Open-Weight-Modell, das sich grundsätzlich außerhalb der Anbieter-API untersuchen und betreiben lässt. Klein ist es dennoch nur relativ zur neuen Modellfamilie und zum jeweils aktiven Rechenpfad.
Der technische Bericht nennt 552 Milliarden Backbone-Parameter und zusätzlich 196 Milliarden Parameter für eine bedingt abgerufene Engram-Speicherkomponente. Hugging Face weist das gesamte Repository mit 763 Milliarden Parametern aus. Diese Größen dürfen nicht mit den 8 beziehungsweise 16 Milliarden aktivierten Parametern pro Token verwechselt werden. Die Architektur spart, indem sie nur einen Teil ihres Umfangs nutzt. Sie verwandelt das Modell nicht in ein kompaktes lokales System.
Die veröffentlichten Gewichte erweitern den Prüfweg: Teams können Inferenz, Quantisierung und eigene Modellbenchmarks untersuchen, statt allein auf die API zu vertrauen. Sie ersetzen aber weder die technische Betriebsprüfung noch einen Test mit den tatsächlichen Aufgaben.
Ein Modellwechsel braucht einen Lauf, keine Rangliste
V4.1-Flash bringt konkrete betriebliche Vorteile. In der am 24. September abrufbaren Modell- und Preisübersicht ↗ kostet eine Million nicht zwischengespeicherte Eingabetokens zur Hauptzeit 0,30 US-Dollar; bei V4-Pro sind es 1,32 US-Dollar. Für eine Million Ausgabetokens stehen 1,20 und 3,96 US-Dollar gegenüber. Die ausgewiesene Parallelitätsgrenze liegt bei 2.500 statt 500 gleichzeitigen Anfragen. Flash verarbeitet außerdem Bilder, während die Tabelle für V4-Pro keine Bildunterstützung ausweist.
Das sind starke Gründe für einen Test, aber noch keine vollständige Kostenrechnung. Ein Agent kann mit dem günstigeren Modell mehr Tokens erzeugen, häufiger Werkzeuge aufrufen oder mehr Korrekturschleifen benötigen. Weshalb der Preis erst nach dem vollständigen Vorgang belastbar wird, erläutert der Beitrag Der Preis beginnt nach dem Token.
Für einen Wechsel sollten deshalb dieselben realen Aufgaben unter denselben Bedingungen laufen:
- identische Werkzeuge, Zugriffsrechte, Abbruchregeln und Kontextgrenzen,
- Messung von Erfolgsquote, Laufzeit, Tokenverbrauch, Werkzeugaufrufen und Wiederholungen,
- Prüfung strukturierter Ausgaben sowie des manuellen Korrekturaufwands.
Gerade bei KI-Agenten gehört die Leistung nicht dem Modell allein. Harness, Kontext, Werkzeugzugriff und Laufregeln verändern das Ergebnis. Der Beitrag Wo der Modellvergleich zerfällt vertieft diese Grenze. Für Redaktionen und Marketingteams belegen die veröffentlichten Tests zudem weder deutsche Textqualität noch Markenkonformität oder faktische Zuverlässigkeit. Solche Eigenschaften brauchen einen eigenen Prüfbestand.
Neu ist der Speicherpfad, nicht der Beweismaßstab
DeepSeek V4.1-Flash ist mehr als ein umbenanntes Update. Der asymmetrische Rechenweg, der stark komprimierte KV-Cache, die native Bildverarbeitung und die offenen Gewichte verändern das Flash-Angebot substanziell. Bei mehreren Agentenbenchmarks liegt das Modell nach den veröffentlichten Werten vor V4-Pro und wird deutlich günstiger angeboten.
Offen bleibt, wann V4.1-Pro erscheint, wie lange das bisherige Pro-Modell verfügbar bleibt und welche externen Prüfungen hinter DeepSeeks Verweis auf mehrere Parteien stehen. Vor allem zeigen die eigenen Tabellen keinen Sieg in jeder Disziplin. Tatsächlich geändert haben sich Architektur, Preis und Einsatzprofil. Dass V4.1-Flash V4-Pro in jedem relevanten Arbeitsablauf ersetzt, bleibt vorerst die größere Behauptung als der vorhandene Beweis.
N.O.A.H. Insights
Zusätzliche Signale und Schlussfolgerungen aus dem Beitrag.
ArchitekturV4.1-Flash spart nicht durch geringe Gesamtgröße, sondern durch einen kleineren aktiven Eingabepfad und einen stark komprimierten KV-Cache.
BenchmarkDer Vorsprung konzentriert sich auf ausführende Agentenaufgaben. Die veröffentlichten Tabellen zeigen zugleich Disziplinen, in denen V4-Pro weiter vorn liegt.
MigrationEin Modellwechsel sollte anhand vollständiger Agentenläufe geprüft werden. Tokenpreis, Erfolgsquote, Werkzeugaufrufe und Korrekturaufwand gehören in dieselbe Auswertung.
Häufige Fragen
Kurze Antworten auf die wichtigsten Fragen zum Beitrag.
Ersetzt DeepSeek V4.1-Flash das Modell V4-Pro?
Nein. Die erste Ankündigung sah eine Weiterleitung der Pro-Aufrufe ab dem 14. September 2026 vor. DeepSeek nahm diesen Schritt wegen der Nachfrage zurück. Stand 24. September sind beide Modelle als getrennte API-Angebote gelistet.
Ist DeepSeek V4.1-Flash wirklich kleiner als V4-Pro?
Der Backbone ist kleiner und pro Token werden deutlich weniger Parameter aktiviert. Das veröffentlichte Modellrepository umfasst dennoch Hunderte Milliarden Parameter. Klein bezeichnet hier vor allem die Position innerhalb der Modellfamilie und den aktiven Rechenpfad.
Beweisen die Benchmarks einen allgemeinen Qualitätsvorsprung?
Nein. V4.1-Flash führt in mehreren Agenten- und Code-Benchmarks, liegt bei einzelnen Wissens- und Reasoning-Tests aber hinter V4-Pro. Zudem stammen die direkten Vergleichswerte aus DeepSeeks eigener Dokumentation.
Quellen zum Beitrag
Diese Referenzen werden im Artikel verlinkt. Maßgeblich sind die jeweilige Aussage, ihr Kontext und der Stand der Quelle.
Bringen Sie KI aus der Theorie in Ihren Arbeitsalltag.
Sehen Sie, wie ANORA Wissen, Modelle, klare Zuständigkeiten und Freigaben in einen kontrollierten Workflow für Ihr Unternehmen übersetzt.
KI-Workflow mit ANORA prüfen