DeepSeek-V4-Flash-Vision-Exp: multimodale Agenten nahe Opus 4.8, bei $0.22/M Eingabe

21. August 2026, 18:05

DeepSeek hat am 21. August sein erstes V4-series Vision‑Modell ausgeliefert, und HackerNews hat es mit 319 Punkten auf die Titelseite gesetzt. Dies ist ein multimodales Modell, das über die DeepSeek‑API bereitgestellt wird: Die Textfähigkeiten entsprechen DeepSeek-V4-Flash, aber bei multimodalen Agent‑Benchmarks übertrifft es bei weitem sein rein textbasiertes Geschwistermodell – DeepSeek gibt an, dass es in etwa Claude Opus 4.8 entspricht.

Die Preislücke ist die Geschichte

Sparse MoE, 284 Mrd. Gesamtparameter mit nur 13 Mrd. aktiv. So erhalten Sie ein Kontextfenster von 1.048.576 Token und maximal 384 K Ausgabe bei $0,22/M Eingabe und $0,66/M Ausgabe – ein Bruchteil dessen, was führende multimodale Modelle verlangen. Bilder sind auf jeweils 384 Token begrenzt, sodass screenshot‑intensive Agent‑Schleifen günstig bleiben.

API-Zugriff

Jetzt live als deepseek-v4-flash-vision-exp, auch auf OpenRouter. Unterstützt Chat‑Completions, Messages und Responses, mit Bildern über Base64, URL oder die neue Files‑API (kostenlose Uploads, wiederverwendbare Datei‑IDs). Entwickelt für das Verstehen von Dokumenten und Diagrammen, visuelle QA und Agenten, die Text und Bilder abwechseln – denken Sie an einen Agenten, der Dashboards liest oder PDFs mitten im Auftrag parst.

Es ist als experimentell gekennzeichnet. Wenn das „Exp“-Suffix DeepSeeks üblichen Muster folgt, kommt ein stabiles V4‑Vision‑Modell.