Zum Hauptinhalt springen
Editoriales Titelmotiv zum Beitrag „DeepSeeks Messlatte ist schon weitergezogen“.
Journal

ANORA Journal

KI Strategie 02.09.2026 5 Min. Lesezeit N.O.A.H.

DeepSeeks Messlatte ist schon weitergezogen

DeepSeek verbindet Bildverarbeitung, Werkzeugnutzung und offene Gewichte. Doch der Vergleich mit Opus 4.8 beschreibt nicht mehr die aktuelle Modellfront.

Im ArtikelInhaltsverzeichnis 4 Kapitel

Ein neues Modell kann Bilder auswerten, Werkzeuge aufrufen und auf eigener Infrastruktur laufen. Auf DeepSeeks Veröffentlichungstabelle zieht trotzdem ein anderer Name zuerst den Blick an: Claude Opus 4.8. Er soll einordnen, wie leistungsfähig DeepSeek V4 Flash Vision Exp ist. Doch diese Messlatte war beim Erscheinen des Modells bereits weitergezogen.

Eine Messlatte aus dem Vormonat

DeepSeek stellte V4 Flash Vision Exp am 21. August 2026 auf seiner Entwicklerplattform vor, wie die offizielle Veröffentlichung ↗ dokumentiert. Anthropic hatte Claude Opus 4.8 am 28. Mai angekündigt und bereits am 24. Juli durch Opus 5 ergänzt. Das geht aus den Mitteilungen zu Claude Opus 4.8 ↗ und Claude Opus 5 ↗ hervor.

Editoriales Begleitmotiv zum Abschnitt „Eine Messlatte aus dem Vormonat“ im Beitrag „DeepSeeks Messlatte ist schon weitergezogen“.
Redaktionelles Begleitmotiv zum Abschnitt „Eine Messlatte aus dem Vormonat“.

Der zeitliche Abstand entwertet DeepSeeks Ergebnisse nicht. Er begrenzt ihre Aussage. In der eigenen Modellkarte erreicht V4 Flash Vision Exp bei ApexBench 36,5 Punkte gegenüber 39,4 für Opus 4.8. Bei Agents’ Last Exam liegt DeepSeek mit 27,3 vor 25,7, bei ZeroBench mit 35,0 vor 34,0. Chartography fällt mit 64,3 zu 65,0 knapp zugunsten von Opus aus. Die Textagenten-Tests ergeben ein gemischteres Bild. Sämtliche Werte stammen aus der DeepSeek-Modellkarte ↗.

„Konkurrenzfähig“ ist deshalb eine vertretbare Beschreibung, solange sie eng gelesen wird: auf ausgewählten KI-Benchmarks, unter den jeweiligen Testbedingungen und gegenüber einem Modell vom Mai 2026. Die Tabelle belegt weder eine allgemeine Gleichwertigkeit noch den Anschluss an die Modellfront vom August. Sie zeigt eine Position, keine Rangordnung für alle Fähigkeiten.

Was DeepSeek tatsächlich geöffnet hat

Die größere Neuerung liegt nicht im Opus-Vergleich. V4 Flash Vision Exp erweitert die V4-Familie um Bildverarbeitung. Ein Vision Encoder übersetzt visuelle Eingaben in maschinenlesbare Repräsentationen; ein Aligner verbindet sie mit dem Sprachmodell. Über die API lassen sich Text und Bilder gemeinsam verarbeiten. DeepSeek nennt dafür unter anderem Bildschirmaufnahmen, Diagramme und andere visuelle Inhalte. Die unterstützten Eingabewege beschreibt die Vision-Dokumentation ↗.

Editoriales Begleitmotiv zum Abschnitt „Was DeepSeek tatsächlich geöffnet hat“ im Beitrag „DeepSeeks Messlatte ist schon weitergezogen“.
Redaktionelles Begleitmotiv zum Abschnitt „Was DeepSeek tatsächlich geöffnet hat“.

Damit wird Sehen vom Analysewerkzeug zum möglichen Ausgangspunkt einer Aktion. Visuelle KI-Agenten können einen Zustand auf einer Oberfläche erfassen, daraus einen nächsten Schritt ableiten und ein Werkzeug aufrufen. Genau an diesem Übergang steigt jedoch das Risiko: Eine falsch gelesene Beschriftung kann einen formal korrekten, aber sachlich falschen Werkzeugaufruf auslösen.

Beispiel: Ein System prüft eine gerenderte Produktseite und erkennt eine Abweichung zwischen Diagramm und Begleittext. Es kann die betroffene Stelle markieren und eine Korrektur vorbereiten. Damit ist noch nicht bewiesen, dass seine Lesart stimmt. Das Modell hat zunächst nur Wahrnehmung in eine Handlung übersetzt.

Inzwischen stehen auch die Gewichte über DeepSeeks offizielles Repository bereit. Die Modellkarte weist eine MIT-Lizenz und eine Größe von 305 Milliarden Parametern aus. DeepSeek V4 Flash Vision Exp ist damit ein Open-Weight-Modell, das unabhängig untersucht und auf eigener Infrastruktur betrieben werden kann. Offen bedeutet hier allerdings nicht leicht: Die Größenordnung verlangt erhebliche Rechen- und Speicherressourcen sowie ein Serving-System, das Bildverarbeitung, Kontext und Werkzeugaufrufe zuverlässig zusammenführt.

Die offenen Gewichte verschieben deshalb vor allem die Art der Abhängigkeit. Statt allein auf einen API-Anbieter angewiesen zu sein, können Teams Betrieb und Evaluation stärker selbst kontrollieren. Dafür übernehmen sie Verantwortung für Infrastruktur, Laufzeitverhalten und Fehleranalyse.

Ein Benchmark misst den Versuchsaufbau mit

Bei Agentenmodellen liegt zwischen Aufgabe und Ergebnis mehr als das neuronale Netz. Prompts, verfügbare Werkzeuge, Laufzeitumgebung, Wiederholungen, Abbruchregeln und Erfolgskriterien beeinflussen das Resultat. Ein Agentenbenchmark misst deshalb immer auch den Versuchsaufbau.

Editoriales Begleitmotiv zum Abschnitt „Ein Benchmark misst den Versuchsaufbau mit“ im Beitrag „DeepSeeks Messlatte ist schon weitergezogen“.
Redaktionelles Begleitmotiv zum Abschnitt „Ein Benchmark misst den Versuchsaufbau mit“.

DeepSeek legt für die aufgeführten Textagenten-Tests Teile dieses Aufbaus offen. Die multimodalen Werte sind in der kompakten Modellkarte weniger detailliert dokumentiert. Das macht sie zu prüfbaren Anbieterangaben, aber noch nicht zu einer unabhängigen Rangordnung.

Wie groß die Protokollfrage werden kann, zeigt Chartography. Das im August 2026 veröffentlichte Paper beschreibt 100 Aufgaben mit professionellen Diagrammen aus mehreren Fachgebieten. Unter 30 getesteten Modellkonfigurationen erreichte die beste Konfiguration dort 45,0 Prozent beim mittleren Pass@1. DeepSeek weist in der eigenen Tabelle 64,3 für V4 Flash Vision Exp und 65,0 für Opus 4.8 aus, ohne an dieser Stelle ein gleich detailliertes visuelles Testprotokoll mitzuliefern. Das ist kein Nachweis eines Fehlers. Es bedeutet, dass die Werte ohne identische Werkzeuge und Regeln nicht direkt vergleichbar sind. Die Ausgangsmethodik steht im Chartography-Paper ↗.

Auch ZeroBench unterscheidet zwischen offiziell durchgeführten Evaluationen und extern gemeldeten Resultaten aus Modellkarten oder Veröffentlichungen. Diese Herkunftsangabe ist entscheidend: Derselbe Benchmarkname garantiert noch nicht dasselbe Experiment. Die ZeroBench-Auswertung ↗ macht diese Trennung sichtbar.

Gerade hier gewinnen die offenen Gewichte an Bedeutung. Sie ermöglichen unabhängige Wiederholungen und veränderte Testaufbauten. Sie ersetzen diese Arbeit aber nicht. Bis vergleichbare Evaluationen vorliegen, bleibt DeepSeeks Nähe zu Opus 4.8 eine begrenzte, vom Anbieter dokumentierte Aussage.

Der Fehler beginnt nach dem Sehen

Für einen belastbaren Praxistest reichen allgemeine Bildfragen nicht. Entscheidend ist, ob das Modell die tatsächlich verwendeten Diagramme, Oberflächen und Fehlermeldungen erkennt. Danach muss sichtbar werden, worauf seine Schlussfolgerung beruht und welche Parameter es an ein Werkzeug übergibt.

Der aufschlussreichste Moment folgt nach einer falschen Aktion. Erkennt das Modell, dass der erwartete Zustand ausgeblieben ist? Korrigiert es sich, fordert es zusätzlichen Kontext an oder setzt es den Fehler mit wachsender Sicherheit fort? Erst diese Reaktion trennt ein Modell, das Bilder beschreiben kann, von einem visuellen Agenten, der in längeren Abläufen belastbar bleibt.

DeepSeek hat die V4-Familie um eine konkrete Fähigkeit erweitert und deren Gewichte zugänglich gemacht. Mehrere Anbieterwerte liegen nahe an Opus 4.8 oder darüber. Nicht belegt ist eine allgemeine Gleichwertigkeit – und erst recht kein Vergleich mit der neueren Modellgeneration.

Die Messlatte ist also weitergezogen. Die technisch wichtigere Grenze liegt ohnehin woanders: nicht im Screenshot, den ein Modell lesen kann, sondern in dem Moment, in dem es bemerkt, dass es ihn falsch gelesen hat.

Einordnung

N.O.A.H. Insights

Zusätzliche Signale und Schlussfolgerungen aus dem Beitrag.

Redaktionelle EinordnungDer Opus-Vergleich ist eng genug, um relevant zu sein, aber zu alt und zu protokollabhängig für eine allgemeine Frontier-Behauptung.

Technischer FortschrittDie eigentliche Neuerung ist die Verbindung von visueller Verarbeitung, Sprachmodell und Werkzeugaufrufen innerhalb der V4-Familie.

Wert der offenen GewichteDas Open-Weight-Modell lässt sich unabhängig untersuchen und betreiben, verlangt mit 305 Milliarden Parametern jedoch anspruchsvolle Infrastruktur.

Offene FrageUnabhängige Tests müssen erst zeigen, wie stabil die Anbieterwerte unter identischen Protokollen und in längeren realen Abläufen bleiben.

FAQ

Häufige Fragen

Kurze Antworten auf die wichtigsten Fragen zum Beitrag.

Was ist DeepSeek V4 Flash Vision Exp?

Es ist ein experimentelles multimodales Modell der DeepSeek-V4-Familie. Es verarbeitet Text und Bilder gemeinsam und kann visuelle Informationen mit Werkzeugaufrufen verbinden.

Ist das Modell so leistungsfähig wie Claude Opus 4.8?

Auf einigen von DeepSeek veröffentlichten Benchmarks liegen beide Modelle nahe beieinander. Daraus folgt keine allgemeine Gleichwertigkeit, weil Aufgaben, Werkzeuge und Testprotokolle die Resultate beeinflussen.

Warum ist der Vergleich mit Opus 4.8 nur begrenzt aktuell?

Anthropic hatte Opus 5 bereits am 24. Juli 2026 angekündigt. DeepSeek veröffentlichte V4 Flash Vision Exp am 21. August und wählte dennoch Opus 4.8 als Referenz.

Kann DeepSeek V4 Flash Vision Exp selbst betrieben werden?

Die Gewichte und Referenzdateien sind über das offizielle DeepSeek-Repository verfügbar. Die Größe von 305 Milliarden Parametern stellt jedoch hohe Anforderungen an Speicher, Beschleuniger und Serving-Infrastruktur.

Wie sollten visuelle Agenten evaluiert werden?

Mit eigenen Diagrammen, Dokumenten und Oberflächen. Geprüft werden sollten Wahrnehmung, Begründung, Werkzeugaufruf und besonders das Verhalten nach einer fehlerhaften Aktion.

Nachvollziehbarkeit

Quellen und Kontext

104 redaktionelle Referenzen und fachliche Grundlagen – kompakt und vollständig nachvollziehbar.

Alle 104 Quellen anzeigen98 weitere Referenzen
api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 endpoints.huggingface.coLive web research · endpoints.huggingface.co · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 www-cdn.anthropic.comLive web research · www-cdn.anthropic.com · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 www.techtimes.comLive web research · www.techtimes.com · 02.09.2026 cellcog.aiLive web research · cellcog.ai · 02.09.2026 nowline.netLive web research · nowline.net · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 pc.watch.impress.co.jpLive web research · pc.watch.impress.co.jp · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 csidia.comLive web research · csidia.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 zerobench.github.ioLive web research · zerobench.github.io · 02.09.2026 arxiv.orgLive web research · arxiv.org · 02.09.2026 benchmarks.darvinyi.comLive web research · benchmarks.darvinyi.com · 02.09.2026 arxiv.orgLive web research · arxiv.org · 02.09.2026 doi.orgLive web research · doi.org · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 ale-robotics.orgLive web research · ale-robotics.org · 02.09.2026 ale-robotics.orgLive web research · ale-robotics.org · 02.09.2026 zerobench.github.ioLive web research · zerobench.github.io · 02.09.2026 snorkel.aiLive web research · snorkel.ai · 02.09.2026 ojs.aaai.orgLive web research · ojs.aaai.org · 02.09.2026 www.itdoeswhatnow.comLive web research · www.itdoeswhatnow.com · 02.09.2026 github.comLive web research · github.com · 02.09.2026 agents100m.comLive web research · agents100m.com · 02.09.2026 arxiv.orgLive web research · arxiv.org · 02.09.2026 arxiv.orgLive web research · arxiv.org · 02.09.2026 openreview.netLive web research · openreview.net · 02.09.2026 openreview.netLive web research · openreview.net · 02.09.2026 datasets-benchmarks-proceedings.neurips.ccLive web research · datasets-benchmarks-proceedings.neurips.cc · 02.09.2026 thrlvemurket.comLive web research · thrlvemurket.com · 02.09.2026 cambridgecvcourses.github.ioLive web research · cambridgecvcourses.github.io · 02.09.2026 openreview.netLive web research · openreview.net · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 ccleaks.comLive web research · ccleaks.com · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 www.digitalapplied.comLive web research · www.digitalapplied.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 www.reddit.comLive web research · www.reddit.com · 02.09.2026 fe-static.deepseek.comLive web research · fe-static.deepseek.com · 02.09.2026 support.huaweicloud.comLive web research · support.huaweicloud.com · 02.09.2026 apnews.comLive web research · apnews.com · 02.09.2026 support.huaweicloud.comLive web research · support.huaweicloud.com · 02.09.2026 openaccess.thecvf.comLive web research · openaccess.thecvf.com · 02.09.2026 arxiv.orgLive web research · arxiv.org · 02.09.2026 en.wikipedia.orgLive web research · en.wikipedia.org · 02.09.2026 en.wikipedia.orgLive web research · en.wikipedia.org · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 www.anthropic.comLive web research · www.anthropic.com · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026 arxiv.orgLive web research · arxiv.org · 02.09.2026 zerobench.github.ioLive web research · zerobench.github.io · 02.09.2026 huggingface.coLive web research · huggingface.co · 02.09.2026 api-docs.deepseek.comLive web research · api-docs.deepseek.com · 02.09.2026
Aus Erkenntnis wird Umsetzung

Bringen Sie KI aus der Theorie in Ihren Arbeitsalltag.

Sehen Sie, wie ANORA Wissen, Modelle, klare Zuständigkeiten und Freigaben in einen kontrollierten Workflow für Ihr Unternehmen übersetzt.

KI-Workflow mit ANORA prüfen