# Un transformeur élagage réduit le cache KV jusqu’à 25 fois

> Des chercheurs présentent Universal Attention, une méthode entraînable qui supprime progressivement les tokens peu importants : elle compresse le cache par 10 sur les tâches courantes et par 25 sur des séquences de 16k tokens.

Oossa · 2026-10-08 · https://oossa.com/fr/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Une équipe dirigée par Ahan Gupta a présenté une nouvelle architecture baptisée Universal Attention. Elle conserve les embeddings positionnels RoPE standard et l’attention Softmax, mais y ajoute un mécanisme d’atténuation entraînable qui détermine quels tokens supprimer pendant l’inférence. Cette méthode réduit le cache clé-valeur — la mémoire utilisée par les grands modèles de langage — sans nuire à la précision. Les tests montrent une réduction par 10 de la taille du cache sur des données courantes et par 25 lors du traitement d’entrées de 16,000 tokens, tout en améliorant les performances sur les tâches en aval.

## Les faits

- Compression du cache KV par 10 sur des tâches de traitement du langage naturel
- Compression par 25 pour des séquences de 16k tokens

## Pourquoi c'est important

Un cache plus petit permet de déployer les grands modèles de langage à moindre coût et plus rapidement sur des appareils à mémoire limitée.

## Sources et références

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Dernière mise à jour: 2026-10-08
