SSysDigest
DeepSeek allège encore son cache mémoire, et c'est une bonne nouvelle pour ton portefeuille

Photo : panumas nikhomkhai sur Pexels

Intelligence Artificielle

DeepSeek allège encore son cache mémoire, et c'est une bonne nouvelle pour ton portefeuille

DeepSeek sort V4.1-Flash, un modèle costaud mais surtout hyper économe en mémoire vive grâce à un cache d'attention divisé par 4. Objectif : rendre les agents IA moins chers à faire tourner.

actuintelligence artificiellemise à jour
Partager :

DeepSeek vient de publier, le 17 septembre 2026, la doc technique de son nouveau modèle V4.1-Flash, disponible depuis le 10 septembre. On parle d'une grosse bête de 552 milliards de paramètres en mélange d'experts, capable de gérer texte et autres formats, avec une fenêtre de contexte qui monte jusqu'à un million de jetons. Mais le vrai coup de génie n'est pas dans la taille, il est dans la façon dont le modèle gère sa mémoire.

Concrètement, son architecture n'active que 16 milliards de paramètres quand il génère du texte, et encore moins (8 milliards) pendant la phase de préremplissage, celle qui bouffe le plus de ressources quand tu fais tourner des agents IA. En réutilisant intelligemment le cache clés-valeurs entre les différentes couches du réseau et en le stockant en FP4 (un format ultra compact), DeepSeek arrive à faire tenir tout ça dans seulement 890 octets par jeton. C'est quatre fois moins que sur la version précédente, et si tu stockes ce cache sur SSD, tu descends même à huit fois moins.

Pourquoi c'est important ? Parce que dans le monde des agents IA qui tournent en continu, le vrai nerf de la guerre, c'est le coût par requête, pas juste le score sur un benchmark. Moins de mémoire consommée, ça veut dire plus de requêtes traitées en parallèle sur le même serveur, donc une facture qui fond. DeepSeek montre ici que l'optimisation de l'infrastructure compte autant que la puissance brute du modèle.

Sources

À lire aussi