DeepSeek veröffentlicht V4 Flash 0731 als öffentliche Beta am 31. Juli. Das Unternehmen sagte, es behielt die Architektur und Größe der früheren Vorschau bei und fügte einen neuen Post-Training-Pass hinzu. Die Version war über die API verfügbar und ersetzte nicht das Pro-Modell von DeepSeek in der Consumer-App, dem Webservice oder der API.

Das Modell unterstützt ein Kontextfenster von einer Million Token und eine maximale Ausgabe von 384.000 Token, so die Dokumentation von DeepSeek. Es enthält auch Responses API und Codex-orientierte Anpassungen. Diese Spezifikationen öffnen Anwendungsfälle mit langen Dokumenten und Kodierung, aber die Fähigkeit, einen sehr großen Kontext zu akzeptieren, zeigt nicht, wie gut das Modell jeden Teil davon nutzt.

Offizielle Preise pro Million Token wurden bei $ 0,0028 für Cache-Hit-Input, $ 0,14 für Cache-Miss-Input und $ 0,28 für Output aufgeführt. Die große Lücke zwischen zwischengespeicherten und nicht zwischengespeicherten Eingaben macht die Workload-Form zentral für jeden Vergleich. Eine Headline-Rate basierend auf Cache-Hits beschreibt keinen Job, der wiederholt neuen Kontext sendet.

Raw-Token-Preise lassen auch Latenz, Argumentations-Token, Wiederholungen, fehlgeschlagene Anrufe und Ausgabequalität aus. Ein Modell kann pro Token kostengünstig, aber pro akzeptiertem Ergebnis teuer sein, wenn die Aufgabe wiederholt korrigiert werden muss. Vergleiche mit GPT, Claude, Gemini oder Kimi sollten die gleichen Eingaben verwenden und das Cache-Verhalten und die Abschlusskriterien melden.

Da es sich bei dem Release um eine Beta handelt, können sich Modellkennungen und Preise ändern. Entwickler sollten den aktiven API-Eintrag vor der Bereitstellung bestätigen und Kostenaufzeichnungen an ein Datum binden. Ein reproduzierbarer Cost-per-Task-Test liefert dauerhaftere Informationen als eine Starttabelle, bei der angenommen wird, dass jeder Token mit der niedrigsten Rate abgerechnet wird.

Wie es weitergeht

Bestätigen Sie das aktive Beta-Modell und die Preisgestaltung und messen Sie dann die gesamten Aufgabenkosten mit Cache-Raten, Latenz, Wiederholungen, Kontextnutzung und fehlgeschlagenen Anrufen.

Quellen

Diese retrospektive Launch-Datei wurde am 3. August 2026 aus den Updates, der Preisseite und dem Modell-Repository von DeepSeek mit der Abdeckung von Axios für den Marktkontext erstellt. AI News of Today hat keinen API-Kosten- oder Qualitätstest durchgeführt.

Wann immer möglich, verlinken wir Originaldokumente und Berichte aus erster Hand.

  1. DeepSeek official updatesPrimärquelle · 31. Juli 2026
  2. DeepSeek official pricingPrimärquelle · 31. Juli 2026
  3. DeepSeek official model repositoryPrimärquelle · 31. Juli 2026
  4. Axios price-war coverageBerichterstattung · 1. August 2026