Kimi Linear : l'attention linéaire qui casse la quadrature du KV Cache

Écrit par Alexandre BEDELEK
Tags : Kimi Linear, Moonshot AI, Attention Linéaire, KV Cache, Architecture

Publié le 25 août 2026 — Dossier technique Architectures LLM.

Le problème : la tyrannie du KV Cache

Dans un Transformer classique (Llama 3, Qwen 2.5), chaque token généré doit calculer son attention par rapport à l’ensemble des tokens précédents. La complexité quadratique ($\mathcal{O}(N^2)$) du mécanisme Softmax fait exploser l’empreinte mémoire du KV Cache (Key-Value Cache) sur les longs contextes.

Sur une fenêtre de 128k ou 1M tokens, le KV Cache dépasse souvent la taille du modèle lui-même, provoquant des Out Of Memory ou forçant des quantifications agressives.

La rupture Kimi Linear

Moonshot AI résout ce compromis historique grâce à deux innovations :

1. Kimi Delta Attention (KDA)

Une extension de Gated DeltaNet exploitant un mécanisme de déclenchement (gating) à grain fin et des matrices de transition Diagonal-Plus-Low-Rank (DPLR). Ce bloc compresse l’historique dans un état récurrent à taille fixe (RNN à état fini) via un algorithme chunkwise optimisé pour le transfert SRAM/VRAM.

2. Hybridation Layerwise

Le modèle (48B paramètres totaux / 3B activés via MoE) alterne par couches entre des blocs KDA et des blocs MLA (Multi-Head Latent Attention).

[ Input Tokens ]


 ┌───────────┐
 ├─ Layer 1  │──► KDA (Linear Attention / État Récurrent Δ)
 ├─ Layer 2  │──► MLA (Multi-Head Latent Attention)
 ├─ Layer 3  │──► KDA (Linear Attention / État Récurrent Δ)
 │   ...     │
 └───────────┘


 [ Output Probabilities ]

Impact mesuré

MétriqueFull Attention (MLA)Kimi LinearGain
Taille KV Cache (1M tokens)100% (baseline)25%-75% VRAM
TPOT (128K context)~1.8 ms~0.9 ms2.0× plus rapide
TPOT (512K context)~6.0 ms~1.1 ms5.7× plus rapide
TPOT (1M context)11.48 ms1.84 ms6.3× plus rapide

Implications pour l’IA locale

Avec la généralisation d’architectures comme Kimi Linear dans llama.cpp et vLLM, la contrainte du KV Cache s’estompe. Il devient possible de maintenir des fenêtres de contexte de 128k tokens sur des configurations UMA grand public sans sacrifier la précision.

L’effondrement du coût du contexte long redéfinit les règles de conception d’un Lab d’IA souverain : les architectures agentiques futures exploiteront une topologie à deux niveaux (modèle ultra-fast sur mémoire haut débit + modèle deep-reasoning sur mémoire unifiée).