
Photo : panumas nikhomkhai sur Pexels
DeepSeek allège encore son cache mémoire, et c'est une bonne nouvelle pour ton portefeuille
DeepSeek sort V4.1-Flash, un modèle costaud mais surtout hyper économe en mémoire vive grâce à un cache d'attention divisé par 4. Objectif : rendre les agents IA moins chers à faire tourner.
DeepSeek vient de publier, le 17 septembre 2026, la doc technique de son nouveau modèle V4.1-Flash, disponible depuis le 10 septembre. On parle d'une grosse bête de 552 milliards de paramètres en mélange d'experts, capable de gérer texte et autres formats, avec une fenêtre de contexte qui monte jusqu'à un million de jetons. Mais le vrai coup de génie n'est pas dans la taille, il est dans la façon dont le modèle gère sa mémoire.
Concrètement, son architecture n'active que 16 milliards de paramètres quand il génère du texte, et encore moins (8 milliards) pendant la phase de préremplissage, celle qui bouffe le plus de ressources quand tu fais tourner des agents IA. En réutilisant intelligemment le cache clés-valeurs entre les différentes couches du réseau et en le stockant en FP4 (un format ultra compact), DeepSeek arrive à faire tenir tout ça dans seulement 890 octets par jeton. C'est quatre fois moins que sur la version précédente, et si tu stockes ce cache sur SSD, tu descends même à huit fois moins.
Pourquoi c'est important ? Parce que dans le monde des agents IA qui tournent en continu, le vrai nerf de la guerre, c'est le coût par requête, pas juste le score sur un benchmark. Moins de mémoire consommée, ça veut dire plus de requêtes traitées en parallèle sur le même serveur, donc une facture qui fond. DeepSeek montre ici que l'optimisation de l'infrastructure compte autant que la puissance brute du modèle.
Sources
À lire aussi

Une journaliste a créé son propre avatar IA... et c'est troublant
Une journaliste tech a fabriqué un clone numérique d'elle-même capable de discuter avec toi, et elle en ressort avec un sentiment plutôt partagé.

Des lunettes qui remplacent les écouteurs à vélo : le test des Shimano Lazer VeloVox
9 mois avec les Lazer VeloVox : des lunettes à conduction osseuse pour écouter sa musique ou téléphoner à vélo, sans se prendre 135 € d'amende pour écouteurs. Verdict.

Microsoft veut faire de Copilot ton seul outil de travail
Microsoft a lancé la plus grosse refonte de Copilot depuis ses débuts : chat, création d'apps et agents autonomes réunis dans une seule appli.