Technologie

DeepSeek V4.1 Flash remplace bientôt Pro : attention au routage automatique

|Auteur: Équipe éditoriale de QUASA|5 min de lecture| 20
DeepSeek V4.1 Flash remplace bientôt Pro : attention au routage automatique

DeepSeek a lancé V4.1 Flash le 10 septembre 2026 et redirigera toutes les requêtes envoyées à deepseek-v4-pro vers ce modèle le 14 septembre à 04 h UTC. L’annonce officielle de DeepSeek précise que ces appels seront alors facturés au tarif de V4.1 Flash, jusqu’au lancement d’une future version V4.1 Pro.

La réponse à la question des intégrateurs est donc directe : une application peut changer automatiquement de modèle et de prix sans modifier la valeur du paramètre model. Une requête qui reste techniquement valide ne garantit pas que le comportement observé avec V4 Pro sera conservé ; les parcours critiques doivent être comparés avant la bascule.

Le calendrier dépend de l’identifiant envoyé

Inventaire des identifiants de l’API DeepSeek et de leur redirection vers DeepSeek-V4.1-Flash.

L’identifiant direct de la nouvelle version est deepseek-flash. Les modèles V4 Flash et V4 Flash Vision Exp ont été retirés lors du lancement, mais leurs identifiants deepseek-v4-flash et deepseek-v4-flash-vision-exp sont temporairement redirigés vers V4.1 Flash pour préserver la compatibilité des applications.

deepseek-v4-pro suit un autre calendrier : il désigne encore V4 Pro avant l’échéance, puis pointera vers V4.1 Flash. Il n’existe donc pas, dans le calendrier publié, de période durant laquelle cet ancien identifiant permettrait de choisir entre les deux moteurs après la bascule.

L’inventaire de migration doit couvrir les identifiants inscrits dans le code, les variables d’environnement, les fichiers de déploiement, les passerelles internes et les configurations conservées par des services tiers. Les journaux devraient distinguer le modèle demandé, l’heure de l’appel et toute métadonnée permettant d’identifier le modèle effectivement servi ; le seul statut HTTP ne révélera pas la substitution.

Le prix change avec le cache et les horaires

Calcul du coût de DeepSeek-V4.1-Flash selon le cache et les plages tarifaires UTC.

Le relevé tarifaire de VentureBeat indique, hors heures pleines et par million de jetons, 0,003 dollar pour les entrées trouvées en cache, 0,15 dollar pour les entrées hors cache et 0,60 dollar pour la sortie. Ces montants doublent du lundi au vendredi entre 01 h et 04 h UTC, puis entre 06 h et 10 h UTC.

Le recalcul ne peut donc pas reposer sur le volume total d’entrée. Il faut séparer les lectures en cache, les entrées non mises en cache et les sorties, puis répartir chaque catégorie entre les plages pleines et creuses. Pour un traitement différable, l’heure d’exécution devient une variable de coût ; pour un service interactif, l’estimation doit suivre la distribution horaire réelle du trafic.

La redirection de Pro devrait réduire le prix unitaire des appels concernés, mais pas nécessairement le coût de chaque tâche terminée. Des sorties plus longues, un taux de cache différent, des tentatives supplémentaires ou davantage d’appels d’outils peuvent absorber une partie de l’écart. La comparaison utile porte donc sur la facture d’un parcours complet, pas seulement sur le prix affiché d’un million de jetons.

Les régressions doivent être isolées avant la bascule

Tant que V4 Pro et deepseek-flash restent accessibles séparément, le contrôle le plus robuste consiste à rejouer un corpus figé sur les deux modèles. Pour chaque requête, il faut conserver la sortie brute, la validité du format, la latence, la consommation de jetons, les appels d’outils et le résultat fonctionnel attendu.

  1. Rejouer les sorties structurées, les schémas JSON et les validations strictes utilisés en production.
  2. Comparer le choix, l’ordre et les arguments des outils dans les parcours agentiques.
  3. Contrôler les prompts sensibles au ton, à la longueur, aux refus et au respect exact des consignes.
  4. Tester les longs contextes et les reprises de session lorsque le cache intervient.
  5. Mesurer le coût par tâche réussie avec les niveaux d’effort réellement employés.

Les seuils doivent être définis par parcours : exactitude minimale, structure obligatoire, durée maximale, budget ou fréquence acceptable d’une intervention humaine. L’objectif n’est pas d’établir quel modèle est supérieur en général, mais de vérifier que le remplacement conserve les propriétés nécessaires au service concerné.

Les performances annoncées ne valent pas encore validation générale

Comparaison contrôlée de V4 Pro et DeepSeek-V4.1-Flash sur les mêmes tests de production.

L’examen publié par TokenCost compte V4.1 Flash devant V4 Pro dans 14 des 16 comparaisons textuelles communes fournies par DeepSeek, tandis que Pro conserve l’avantage sur GPQA Diamond et sur la variante sans outils de Humanity’s Last Exam. Cette analyse signalait également, au moment du lancement, l’absence d’une évaluation indépendante complète du nouveau modèle.

Ces résultats ne permettent pas de promettre une amélioration uniforme. Ils proviennent principalement du dispositif d’évaluation du fournisseur et ne décrivent pas nécessairement la stabilité d’un schéma JSON, le choix d’un outil, la latence d’un service précis ou le coût d’une tâche réussie. Les benchmarks doivent donc rester séparés des résultats obtenus sur les charges propres à chaque intégration.

La phase transitoire n’a pas encore de date de fin

La redirection de deepseek-v4-pro doit durer jusqu’à la disponibilité de V4.1 Pro, dont aucune date n’a été publiée. Pendant cette période, l’identifiant conservera le mot « pro » alors que le modèle servi et la grille tarifaire seront ceux de Flash, ce qui peut fausser les tableaux de bord qui classent les coûts uniquement par nom demandé.

À ce stade, le lancement de V4.1 Flash, le routage déjà actif des anciens identifiants Flash et la prochaine bascule de deepseek-v4-pro sont établis. Restent inconnus la durée de la transition, les éventuelles limites propres au trafic redirigé et les résultats d’évaluations externes assez larges pour confirmer les performances revendiquées.

À lire aussi:

Partager:

Abonnez-vous à notre newsletter

Recevez directement les dernières actualités sur le Web3, l’IA et les cryptomonnaies.

0