Après avoir lancé V4-Pro en avril dernier, DeepSeek poursuit sa course à l’efficacité. L’entreprise chinoise a présenté le 10 septembre V4.1-Flash, le plus petit modèle de sa famille V4.1. Son objectif est de combiner davantage de capacités avec une inférence plus rapide et un coût d’utilisation réduit. Initialement, DeepSeek prévoyait de mettre fin au service de V4-Pro à partir du 14 septembre 2026. L’entreprise a finalement annulé cette mise hors service et maintient son modèle phare en service, malgré l’arrivée de V4.1-Flash.
Le modèle repose sur une architecture Mixture-of-Experts (MoE) de 552 milliards de paramètres. Contrairement à un modèle dense de cette taille, seule une partie des paramètres est toutefois activée lors du traitement. DeepSeek indique que sa nouvelle architecture Causal Encoder-Decoder mobilise ainsi 8 milliards de paramètres pour les entrées et 16 milliards pour les sorties.
Un cache moins gourmand en mémoire
DeepSeek met particulièrement en avant le travail réalisé sur le KV cache, un composant important pour les applications exploitant de longs contextes et les agents IA. Selon l’entreprise, V4.1-Flash nécessite quatre fois moins de mémoire HBM et huit fois moins de stockage SSD pour son cache que la génération précédente. Cette optimisation présente un intérêt économique direct. Dans les applications agentiques, le coût du cache peut représenter une part importante de la facture. En réduisant les besoins en mémoire et en stockage, DeepSeek cherche donc à abaisser le coût d’utilisation de ses modèles, notamment pour les déploiements à grande échelle. L’enjeu est également lié aux infrastructures. Alors que les modèles IA deviennent toujours plus lourds, les entreprises cherchent à augmenter le nombre de requêtes traitées sans accroître dans les mêmes proportions leurs ressources GPU et leurs capacités de stockage.
Sur le plan des performances, DeepSeek affirme que V4.1-Flash obtient de meilleurs résultats que plusieurs modèles de référence, dont son propre V4-Pro, selon les benchmarks présentés par l’entreprise. Le groupe chinois indique également que plusieurs évaluations externes placent son nouveau modèle devant V4-Pro en matière de performances, de coût, de vitesse et de temps d’exécution total. V4.1-Flash dispose par ailleurs d’une compréhension native des contenus visuels et est accessible via l’API de DeepSeek sous le nom deepseek-flash. Les anciennes versions V4-Flash et V4-Flash-Vision-Exp sont pour leur part retirées et temporairement redirigées vers V4.1-Flash.
Des tarifs réduits pour les utilisateurs
DeepSeek veut également répercuter ces gains d’efficacité sur ses clients. Les nouveaux tarifs sont entrés en vigueur le 10 septembre, avec une différence entre les périodes de pointe et les périodes creuses. En dehors des heures de pointe, les prix sont réduits de moitié. V4.1-Flash est ainsi facturé entre 0,003 et 0,006 dollar par million de tokens en entrée lorsque le cache est utilisé, contre 0,15 à 0,30 dollar sans cache. La sortie est facturée entre 0,60 et 1,20 dollar par million de tokens selon la période.
DeepSeek entend enfin travailler avec la communauté open source sur le support de l’inférence de V4.1-Flash et explorer de nouvelles possibilités de déploiement. L’entreprise évoque notamment des projets nécessitant des infrastructures importantes, avec des configurations pouvant atteindre 2 000 GPU et un cluster de stockage.