Kimi Linear : l'attention linéaire qui casse la quadrature du KV Cache
Publié le 25 août 2026 — Dossier technique Architectures LLM.
Le problème : la tyrannie du KV Cache
Dans un Transformer classique (Llama 3, Qwen 2.5), chaque token généré doit calculer son attention par rapport à l’ensemble des tokens précédents. La complexité quadratique ($\mathcal{O}(N^2)$) du mécanisme Softmax fait exploser l’empreinte mémoire du KV Cache (Key-Value Cache) sur les longs contextes.
Sur une fenêtre de 128k ou 1M tokens, le KV Cache dépasse souvent la taille du modèle lui-même, provoquant des Out Of Memory ou forçant des quantifications agressives.
La rupture Kimi Linear
Moonshot AI résout ce compromis historique grâce à deux innovations :
1. Kimi Delta Attention (KDA)
Une extension de Gated DeltaNet exploitant un mécanisme de déclenchement (gating) à grain fin et des matrices de transition Diagonal-Plus-Low-Rank (DPLR). Ce bloc compresse l’historique dans un état récurrent à taille fixe (RNN à état fini) via un algorithme chunkwise optimisé pour le transfert SRAM/VRAM.
2. Hybridation Layerwise
Le modèle (48B paramètres totaux / 3B activés via MoE) alterne par couches entre des blocs KDA et des blocs MLA (Multi-Head Latent Attention).
[ Input Tokens ]
│
▼
┌───────────┐
├─ Layer 1 │──► KDA (Linear Attention / État Récurrent Δ)
├─ Layer 2 │──► MLA (Multi-Head Latent Attention)
├─ Layer 3 │──► KDA (Linear Attention / État Récurrent Δ)
│ ... │
└───────────┘
│
▼
[ Output Probabilities ]
Impact mesuré
| Métrique | Full Attention (MLA) | Kimi Linear | Gain |
|---|---|---|---|
| Taille KV Cache (1M tokens) | 100% (baseline) | 25% | -75% VRAM |
| TPOT (128K context) | ~1.8 ms | ~0.9 ms | 2.0× plus rapide |
| TPOT (512K context) | ~6.0 ms | ~1.1 ms | 5.7× plus rapide |
| TPOT (1M context) | 11.48 ms | 1.84 ms | 6.3× plus rapide |
Implications pour l’IA locale
Avec la généralisation d’architectures comme Kimi Linear dans llama.cpp et vLLM, la contrainte du KV Cache s’estompe. Il devient possible de maintenir des fenêtres de contexte de 128k tokens sur des configurations UMA grand public sans sacrifier la précision.
L’effondrement du coût du contexte long redéfinit les règles de conception d’un Lab d’IA souverain : les architectures agentiques futures exploiteront une topologie à deux niveaux (modèle ultra-fast sur mémoire haut débit + modèle deep-reasoning sur mémoire unifiée).