DeepSeek a lancé V4 Flash 0731 en bêta publique le 31 juillet. L'entreprise affirme avoir conservé l'architecture et la taille de la version préliminaire précédente tout en ajoutant une nouvelle phase de post-entraînement. La sortie était accessible par API et ne remplaçait pas le modèle Pro de DeepSeek dans l'application grand public, le service web ou l'API.

Selon la documentation de DeepSeek, le modèle accepte une fenêtre de contexte d'un million de jetons et peut produire jusqu'à 384 000 jetons. Il comprend aussi des adaptations pour la Responses API et Codex. Ces caractéristiques ouvrent des usages sur de longs documents et dans la programmation, mais la capacité à accepter un très grand contexte ne montre pas avec quelle efficacité chaque partie est exploitée.

Les tarifs officiels par million de jetons étaient de 0,0028 dollar pour les entrées trouvées dans le cache, 0,14 dollar pour les entrées absentes du cache et 0,28 dollar pour les sorties. L'écart important entre les deux types d'entrée place la forme de la charge de travail au centre de toute comparaison. Un prix affiché à partir des succès du cache ne décrit pas une tâche qui envoie sans cesse un nouveau contexte.

Les seuls tarifs par jeton ne tiennent pas compte de la latence, des jetons de raisonnement, des nouvelles tentatives, des appels en échec ou de la qualité des résultats. Un modèle peut coûter peu par jeton mais cher par résultat accepté si la tâche exige des corrections répétées. Les comparaisons avec GPT, Claude, Gemini ou Kimi doivent utiliser les mêmes entrées et publier le comportement du cache ainsi que les critères d'achèvement.

Comme il s'agit d'une bêta, les identifiants de modèle et les tarifs peuvent évoluer. Les développeurs doivent confirmer l'entrée API active avant tout déploiement et rattacher leurs relevés de coûts à une date. Un essai reproductible du coût par tâche apportera une information plus durable qu'un tableau de lancement supposant que chaque jeton bénéficie du tarif le plus bas.

La suite à surveiller

Il faudra confirmer le modèle bêta et les tarifs actifs, puis mesurer le coût complet par tâche en publiant les taux de cache, la latence, les nouvelles tentatives, l'utilisation du contexte et les appels en échec.

Sources

Ce dossier rétrospectif sur le lancement a été préparé le 3 août 2026 à partir des mises à jour de DeepSeek, de sa page de tarifs et du dépôt du modèle, avec un article d'Axios pour le contexte commercial. AI News of Today n'a pas mené de test de coût ou de qualité sur l'API.

Dans la mesure du possible, nous renvoyons aux documents d'origine et aux témoignages directs.

  1. DeepSeek official updatesSource primaire · 31 juillet 2026
  2. DeepSeek official pricingSource primaire · 31 juillet 2026
  3. DeepSeek official model repositorySource primaire · 31 juillet 2026
  4. Axios price-war coverageReportage · 1 août 2026