{"id":202207,"date":"2026-09-10T10:16:00","date_gmt":"2026-09-10T09:16:00","guid":{"rendered":"https:\/\/cms-articles.softonic.io\/fr\/?p=202207"},"modified":"2026-09-10T10:16:05","modified_gmt":"2026-09-10T09:16:05","slug":"deepseek-lance-v4-1-flash-1-million-de-tokens-sans-exploser-la-memoire","status":"publish","type":"post","link":"https:\/\/cms-articles.softonic.io\/fr\/deepseek-lance-v4-1-flash-1-million-de-tokens-sans-exploser-la-memoire\/","title":{"rendered":"DeepSeek lance V4.1-Flash: 1 million de tokens sans exploser la m\u00e9moire"},"content":{"rendered":"<p class=\"wp-block-paragraph\">Au moment o\u00f9 nous \u00e9crivons ces lignes, le labo d\u2019IA DeepSeek a mis en ligne DeepSeek-V4.1-Flash. Cette nouvelle version \u00e0 poids ouverts s\u2019attaque \u00e0 un probl\u00e8me tr\u00e8s concret : faire tourner des mod\u00e8les \u00e9normes avec des fen\u00eatres de contexte tr\u00e8s longues, sans voir <strong><a href=\"https:\/\/fr.softonic.com\/articles\/deepseek-preparerait-sa-propre-puce-ia-dabord-pour-linference\" rel=\"noopener\">les besoins m\u00e9moire<\/a><\/strong> partir dans tous les sens.<\/p>\n<div class=\"sc-card-program\">\r\n  <div class=\"sc-card-program__body\">\r\n    <div class=\"sc-card-program__row clearfix\">\r\n      <div class=\"sc-card-program__col-logo\">\r\n        <img decoding=\"async\" class=\"sc-card-program__img\" src=\"https:\/\/images.sftcdn.net\/images\/t_app-icon-s\/p\/eb86f4a1-c347-4209-bc4c-2ce9257d4f8b\/873460266\/deepseek-logo\" alt=\"DeepSeek - AI Assistant\" width=\"100px\" height=\"100px\">\r\n      <\/div>\r\n      <div class=\"sc-card-program__col-title\">\r\n        <span class=\"sc-card-program__title\">DeepSeek - AI Assistant<\/span>\r\n        <a class=\"sc-card-program__button sc-card-program-internal\" href=\"https:\/\/deepseek-ai-assistant.fr.softonic.com\/\" target=\"_self\" rel=\"noopener noreferrer\">T\u00e9l\u00e9charger<\/a>\r\n      <\/div>\r\n      <div class=\"sc-card-program__col-rating\">\r\n        \r\n      <\/div>\r\n    <\/div>\r\n    <div class=\"sc-card-program__row\">\r\n      <span class=\"sc-card-program__description\"><\/span>\r\n    <\/div>\r\n    <div class=\"sc-card-program__row\">\r\n      <img decoding=\"async\" class=\"sc-card-program__bigpic\" src=\"\">\r\n    <\/div>\r\n    <a class=\"sc-card-program__link track-link sc-card-program-internal\" href=\"https:\/\/deepseek-ai-assistant.fr.softonic.com\/\" target=\"_self\" rel=\"noopener noreferrer\"><\/a>\r\n  <\/div>\r\n<\/div>\n\n\n\n<p class=\"wp-block-paragraph\">La promesse est loin d\u2019\u00eatre modeste. DeepSeek affirme que DeepSeek-V4.1-Flash peut g\u00e9rer <strong>jusqu\u2019\u00e0 1 million<\/strong> de tokens, soit autour de 750\u202f000 mots. La soci\u00e9t\u00e9 dit aussi avoir revu l\u2019architecture du mod\u00e8le et compact\u00e9 le cache KV pour faire baisser nettement les co\u00fbts d\u2019exploitation.<\/p>\n\n<p class=\"wp-block-paragraph\">Sur le papier, l\u2019\u00e9chelle donne le vertige. DeepSeek d\u00e9crit un syst\u00e8me multimodal de type Mixture-of-Experts avec 552 milliards de param\u00e8tres pour le backbone, auxquels viennent s\u2019ajouter 196 milliards de param\u00e8tres Engram. Plus surprenant, l\u2019\u00e9diteur explique que seule une petite partie de l\u2019ensemble s\u2019active \u00e0 chaque token : 8 milliards de param\u00e8tres pendant le pr\u00e9remplissage, puis 16 milliards lors de la g\u00e9n\u00e9ration.<\/p>\n\n<p class=\"wp-block-paragraph\">C\u2019est l\u00e0, d\u2019apr\u00e8s DeepSeek, que se joue une bonne partie de l\u2019int\u00e9r\u00eat du mod\u00e8le. Malgr\u00e9 sa taille totale, il resterait <strong>plus efficace qu\u2019on<\/strong> pourrait le croire, surtout sur les charges longues, comme les agents ou les historiques tr\u00e8s volumineux.<\/p>\n\n<p class=\"wp-block-paragraph\">L\u2019autre grosse annonce touche au cache KV, qui reste l\u2019un des principaux goulets d\u2019\u00e9tranglement sur ce genre de d\u00e9ploiement. DeepSeek avance une empreinte globale de <strong>890 octets<\/strong> par token. Cela repr\u00e9senterait environ un quart de celle de DeepSeek-V4-Flash, et presque 437 fois moins que DeepSeek-V1.<\/p>\n\n<p class=\"wp-block-paragraph\">Dit plus simplement, si l\u2019on en croit l\u2019entreprise, la pression baisse \u00e0 la fois sur la m\u00e9moire HBM, sur le stockage SSD et sur la bande passante.<\/p>\n\n<p class=\"wp-block-paragraph\">Pour en arriver l\u00e0, DeepSeek a remani\u00e9 la structure du mod\u00e8le. La documentation publi\u00e9e par la soci\u00e9t\u00e9 d\u00e9crit un backbone de 40 couches, scind\u00e9 en deux ensembles : un encodeur causal de 20 couches, puis un d\u00e9codeur de 20 couches.<\/p>\n\n<p class=\"wp-block-paragraph\">Les tokens du prompt restent dans l\u2019encodeur. Le d\u00e9codeur, lui, produit un KV global \u00e0 partir de l\u2019\u00e9tat cach\u00e9 final de cet encodeur. DeepSeek explique que cette m\u00e9thode r\u00e9duit <strong>presque de moiti\u00e9<\/strong> le calcul n\u00e9cessaire pendant le pr\u00e9remplissage, autrement dit au moment o\u00f9 tout le prompt est trait\u00e9 avant de commencer \u00e0 g\u00e9n\u00e9rer la r\u00e9ponse.<\/p>\n\n<p class=\"wp-block-paragraph\">Le mod\u00e8le embarque aussi une nouvelle architecture d\u2019attention, appel\u00e9e CSA2, pour Compressed Sparse Attention 2. D\u2019apr\u00e8s DeepSeek, les couches sont r\u00e9parties entre plusieurs modes, Full, Reindex et Reuse, avec un objectif clair : r\u00e9utiliser des KV entre les couches et \u00e9viter que le co\u00fbt de recherche n\u2019explose sur les s\u00e9quences tr\u00e8s longues.<\/p>\n\n<p class=\"wp-block-paragraph\">C\u00f4t\u00e9 d\u00e9codeur, l\u2019entreprise affirme que l\u2019indexation hi\u00e9rarchique peut ramener les candidats \u00e0 un maximum de <strong>16\u202f384 positions<\/strong>. DeepSeek ajoute \u00e0 cela une quantification FP4 du cache KV principal, avec un format de type E2M1 et une \u00e9chelle E4M3 par groupe de 16 canaux. L\u00e0 encore, le but est simple : r\u00e9duire encore l\u2019empreinte m\u00e9moire par rapport au FP8 de V4.<\/p>\n\n<p class=\"wp-block-paragraph\">Pour l\u2019attention en fen\u00eatre glissante, DeepSeek indique que le mod\u00e8le travaille avec une fen\u00eatre de <strong>128 tokens<\/strong>. Les \u00e9tats n\u00e9cessaires sont ensuite reconstruits en rejouant uniquement les 128 derniers tokens du prompt.<\/p>\n\n<p class=\"wp-block-paragraph\">DeepSeek-V4.1-Flash est propos\u00e9 sous licence MIT. Il est pris en charge par vLLM, SGLang et Transformers via Hugging Face. En production, la soci\u00e9t\u00e9 dit stocker le KV de la fen\u00eatre glissante dans un pool distribu\u00e9 qui utilise <strong>10 %<\/strong> de la DRAM h\u00f4te, avec une dur\u00e9e de vie de quelques minutes. Le KV global, lui, b\u00e9n\u00e9ficierait d\u2019une r\u00e9tention garantie de 72 heures.<\/p>\n\n<p class=\"wp-block-paragraph\">En usage concret, DeepSeek pr\u00e9sente ce mod\u00e8le comme plus rapide et moins co\u00fbteux que les versions pr\u00e9c\u00e9dentes. Ses tests b\u00eata parlent d\u2019un d\u00e9bit pouvant aller jusqu\u2019\u00e0 <strong>427 tokens par seconde<\/strong>. L\u2019entreprise va m\u00eame jusqu\u2019\u00e0 laisser entendre qu\u2019il pourrait, sur certains cas d\u2019usage, remplacer DeepSeek-V4 Pro.<\/p>\n\n<p class=\"wp-block-paragraph\">Pour l\u2019instant, les \u00e9valuations ind\u00e9pendantes restent rares. Les premiers retours de la communaut\u00e9 sont plut\u00f4t bons sur la vitesse et sur le prix. En revanche, certains utilisateurs parlent aussi de r\u00e9sultats plus in\u00e9gaux sur les fonctions multimodales, surtout sur la partie vision.<\/p>\n\n<p class=\"wp-block-paragraph\">Mieux vaut donc garder un peu de recul. La fiche technique publi\u00e9e par DeepSeek est s\u00e9rieuse, mais le <strong><a href=\"https:\/\/fr.softonic.com\/telechargements\/applications-d-intelligence-artificielle\" rel=\"noopener\">vrai jugement<\/a><\/strong> viendra des essais en conditions r\u00e9elles. Nous vous tiendrons au courant.<\/p>\n\n<p class=\"wp-block-paragraph\">Suivez-moi sur Twitter : @pierrevitre<\/p>","protected":false},"excerpt":{"rendered":"<p>Au moment o\u00f9 nous \u00e9crivons ces lignes, le labo d\u2019IA DeepSeek a mis en ligne DeepSeek-V4.1-Flash. Cette nouvelle version \u00e0 poids ouverts s\u2019attaque \u00e0 un probl\u00e8me tr\u00e8s concret : faire tourner des mod\u00e8les \u00e9normes avec des fen\u00eatres de contexte tr\u00e8s longues, sans voir les besoins m\u00e9moire partir dans tous les sens. La promesse est loin &hellip; <a href=\"https:\/\/cms-articles.softonic.io\/fr\/deepseek-lance-v4-1-flash-1-million-de-tokens-sans-exploser-la-memoire\/\" class=\"more-link\">Continue reading<span class=\"screen-reader-text\"> &#8220;DeepSeek lance V4.1-Flash: 1 million de tokens sans exploser la m\u00e9moire&#8221;<\/span><\/a><\/p>\n","protected":false},"author":9350,"featured_media":202206,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","wpcf-pageviews":0},"categories":[16761],"tags":[],"usertag":[],"vertical":[],"content-category":[17507],"class_list":["post-202207","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-news","content-category-ia"],"aioseo_notices":[],"_links":{"self":[{"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/posts\/202207","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/users\/9350"}],"replies":[{"embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/comments?post=202207"}],"version-history":[{"count":1,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/posts\/202207\/revisions"}],"predecessor-version":[{"id":202208,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/posts\/202207\/revisions\/202208"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/media\/202206"}],"wp:attachment":[{"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/media?parent=202207"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/categories?post=202207"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/tags?post=202207"},{"taxonomy":"usertag","embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/usertag?post=202207"},{"taxonomy":"vertical","embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/vertical?post=202207"},{"taxonomy":"content-category","embeddable":true,"href":"https:\/\/cms-articles.softonic.io\/fr\/wp-json\/wp\/v2\/content-category?post=202207"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}