Au moment où nous écrivons ces lignes, le labo d’IA DeepSeek a mis en ligne DeepSeek-V4.1-Flash. Cette nouvelle version à poids ouverts s’attaque à un problème très concret : faire tourner des modèles énormes avec des fenêtres de contexte très longues, sans voir les besoins mémoire partir dans tous les sens.
La promesse est loin d’être modeste. DeepSeek affirme que DeepSeek-V4.1-Flash peut gérer jusqu’à 1 million de tokens, soit autour de 750 000 mots. La société dit aussi avoir revu l’architecture du modèle et compacté le cache KV pour faire baisser nettement les coûts d’exploitation.
Sur le papier, l’échelle donne le vertige. DeepSeek décrit un système multimodal de type Mixture-of-Experts avec 552 milliards de paramètres pour le backbone, auxquels viennent s’ajouter 196 milliards de paramètres Engram. Plus surprenant, l’éditeur explique que seule une petite partie de l’ensemble s’active à chaque token : 8 milliards de paramètres pendant le préremplissage, puis 16 milliards lors de la génération.
C’est là, d’après DeepSeek, que se joue une bonne partie de l’intérêt du modèle. Malgré sa taille totale, il resterait plus efficace qu’on pourrait le croire, surtout sur les charges longues, comme les agents ou les historiques très volumineux.
L’autre grosse annonce touche au cache KV, qui reste l’un des principaux goulets d’étranglement sur ce genre de déploiement. DeepSeek avance une empreinte globale de 890 octets par token. Cela représenterait environ un quart de celle de DeepSeek-V4-Flash, et presque 437 fois moins que DeepSeek-V1.
Dit plus simplement, si l’on en croit l’entreprise, la pression baisse à la fois sur la mémoire HBM, sur le stockage SSD et sur la bande passante.
Pour en arriver là, DeepSeek a remanié la structure du modèle. La documentation publiée par la société décrit un backbone de 40 couches, scindé en deux ensembles : un encodeur causal de 20 couches, puis un décodeur de 20 couches.
Les tokens du prompt restent dans l’encodeur. Le décodeur, lui, produit un KV global à partir de l’état caché final de cet encodeur. DeepSeek explique que cette méthode réduit presque de moitié le calcul nécessaire pendant le préremplissage, autrement dit au moment où tout le prompt est traité avant de commencer à générer la réponse.
Le modèle embarque aussi une nouvelle architecture d’attention, appelée CSA2, pour Compressed Sparse Attention 2. D’après DeepSeek, les couches sont réparties entre plusieurs modes, Full, Reindex et Reuse, avec un objectif clair : réutiliser des KV entre les couches et éviter que le coût de recherche n’explose sur les séquences très longues.
Côté décodeur, l’entreprise affirme que l’indexation hiérarchique peut ramener les candidats à un maximum de 16 384 positions. DeepSeek ajoute à cela une quantification FP4 du cache KV principal, avec un format de type E2M1 et une échelle E4M3 par groupe de 16 canaux. Là encore, le but est simple : réduire encore l’empreinte mémoire par rapport au FP8 de V4.
Pour l’attention en fenêtre glissante, DeepSeek indique que le modèle travaille avec une fenêtre de 128 tokens. Les états nécessaires sont ensuite reconstruits en rejouant uniquement les 128 derniers tokens du prompt.
DeepSeek-V4.1-Flash est proposé sous licence MIT. Il est pris en charge par vLLM, SGLang et Transformers via Hugging Face. En production, la société dit stocker le KV de la fenêtre glissante dans un pool distribué qui utilise 10 % de la DRAM hôte, avec une durée de vie de quelques minutes. Le KV global, lui, bénéficierait d’une rétention garantie de 72 heures.
En usage concret, DeepSeek présente ce modèle comme plus rapide et moins coûteux que les versions précédentes. Ses tests bêta parlent d’un débit pouvant aller jusqu’à 427 tokens par seconde. L’entreprise va même jusqu’à laisser entendre qu’il pourrait, sur certains cas d’usage, remplacer DeepSeek-V4 Pro.
Pour l’instant, les évaluations indépendantes restent rares. Les premiers retours de la communauté sont plutôt bons sur la vitesse et sur le prix. En revanche, certains utilisateurs parlent aussi de résultats plus inégaux sur les fonctions multimodales, surtout sur la partie vision.
Mieux vaut donc garder un peu de recul. La fiche technique publiée par DeepSeek est sérieuse, mais le vrai jugement viendra des essais en conditions réelles. Nous vous tiendrons au courant.
Suivez-moi sur Twitter : @pierrevitre