DeepSeek V4 sous le capot : attention compressée, MoE épars et FP4/FP8

Écrit par Alexandre BEDELEK
Tags : DeepSeek, Architecture, MoE, Optimisation

Derrière les chiffres spectaculaires (et le séisme boursier) de la génération V4, il y a une vraie révolution technique. Forcé par les contraintes matérielles de l'embargo, DeepSeek a dû repenser l'architecture des modèles de langage pour réduire drastiquement la mémoire et le calcul. Plongée dans les mécanismes qui rendent V4 Flash et V4 Pro si efficaces.


Deux modèles, une philosophie commune

La gamme V4 combine un modèle phare à très haute capacité (le Pro) et une déclinaison économique optimisée pour la vitesse et le déploiement local (le Flash). Les deux reposent sur une architecture à mélange d'experts épars (Sparse Mixture-of-Experts), où seuls quelques milliards de paramètres sont activés à chaque token.

CaractéristiqueV4 Flash (0731)V4 Pro (0813)
Paramètres (total / actifs)284 Md / 13 Md1 600 Md (1,6 T) / 49 Md
Architecture attentionMixed Sliding Window & CompressedCSA (Compressed Sparse) + HCA
Contexte / Output max1 M / 16-32k1 M / 384 000 tokens
Pré-entraînement> 14,8 à 20T tokens> 32 000 Md (32T) tokens
Terminal Bench 2.182,7 %87,9 %
NL2Repo54,2 %61,5 %
SWE-bench Verified54,4 %80,6 %
GPQA Diamond90,8 %90,1 %
LicenceMITMIT

Le Flash 0731, spécifiquement ré-entraîné pour les flux de travail agentiques, le code et le raisonnement logique, intègre l'inférence spéculative DSpark (décodage accéléré de 1,5× à 2×) et trois modes de réflexion (Non-think, Think High, Think Max). Le Pro 0813, pré-entraîné sur plus de 32 trillions de tokens, vise l'ingénierie logicielle complexe et les agents autonomes, avec une sortie pouvant atteindre 384 000 tokens.


L'attention hybride : un contexte compressé

La première innovation majeure remplace la Multi-Head Latent Attention classique par une attention hybride combinant Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA). Le principe : compresser le contexte pour réduire le cache Clé-Valeur.

  • Mode c4a : compresse le cache KV en faisant la somme pondérée de 8 tokens non compressés avec un pas de 4.

  • Mode c128a : un token résumé représente 128 tokens non compressés.

  • Fenêtre glissante de 128 tokens : préserve l'information locale immédiate avant la frontière de compression.

Résultat : le KV cache est réduit à 10 % des besoins de la génération V3.2 (de 83,9 GiB à 9,62 GiB par séquence de 1M tokens en BF16), et les calculs d'inférence sont comprimés à 27 % des FLOPs équivalents. Une économie de mémoire et de calcul massive.


Les hyper-connexions mHC : stabiliser les réseaux très profonds

Dans les architectures MoE à des dizaines de couches, la variance des flux résiduels tend à s'amplifier de façon incontrôlée — jusqu'à un facteur 3 000 dans les systèmes non contraints. Les hyper-connexions contraintes par variété (mHC) résolvent ce problème en appliquant l'algorithme de Sinkhorn-Knopp pour projeter les matrices de connexion sur une variété mathématique fermée.

L'amplification du signal est ainsi restreinte à un facteur maximal de 1,6×, ce qui permet d'élargir le flux résiduel d'un facteur 4 pour un surcoût d'entraînement marginal de 6,7 %. Une stabilisation qui rend possibles les modèles extrêmement profonds de la génération V4.


La mémoire Engram : un accès O(1) aux faits

DeepSeek V4 intègre Engram Conditional Memory, une couche de recherche par hachage à complexité constante O(1) qui fonctionne indépendamment du réseau d'attention principal. Lorsqu'une donnée factuelle statique est détectée dans la requête, le modèle la récupère directement depuis ce composant.

Ce mécanisme « libère » la capacité des têtes d'attention pour les tâches nécessitant un raisonnement logique lourd, au lieu de gaspiller leurs ressources à rappeler des faits déjà connus. Une séparation intelligente entre mémoire et raisonnement.


FP4/FP8 : l'entraînement en précision mixte

La génération V4 valide l'usage de la précision mixte FP4/FP8 en entraînement conscient de la quantification (Quantization-Aware Training, QAT). Les poids des experts MoE sont directement quantifiés en FP4 pendant la rétropropagation, tout en conservant une précision FP8 ou BF16 sur les sous-réseaux critiques.

Cette approche permet une déquantification FP4 vers FP8 sans perte dynamique et accélère les calculs matriciels GEMM jusqu'à 33 %. Combinée à l'attention compressée, elle explique comment V4 atteint un tel niveau de performance avec si peu de ressources.


DualPipe et le coût d'entraînement

L'efficacité de V4 ne vient pas seulement de l'architecture : elle repose aussi sur la bibliothèque de communication DualPipe, qui chevauche de façon quasi idéale les phases de calcul tensoriel et les phases de transfert de données inter-nœuds lors de l'acheminement des tokens vers les experts MoE. C'est ce chevauchement qui a permis d'entraîner le modèle de base sur plus de 14,8 à 32 trillions de tokens en seulement 2,788 millions d'heures GPU H800, pour moins de 6 millions de dollars.


Conclusion

La génération V4 valide la transition vers des architectures à attention comprimée et à mélange d'experts optimisés, réduisant substantiellement les besoins en mémoire et en calcul. Combinées au logiciel libre MIT et à l'inférence spéculative, ces innovations participent à la commoditisation progressive des modèles de base. À l'avenir, la compétitivité en IA dépendra tout autant de l'élégance des architectures que du volume brut d'infrastructures mobilisées.