Oossa

Un transformeur élagage réduit le cache KV jusqu’à 25 fois

Des chercheurs présentent Universal Attention, une méthode entraînable qui supprime progressivement les tokens peu importants : elle compresse le cache par 10 sur les tâches courantes et par 25 sur des séquences de 16k tokens.

BrèvePar Publié par Oossa: 1 min de lecture

Une équipe dirigée par Ahan Gupta a présenté une nouvelle architecture baptisée Universal Attention. Elle conserve les embeddings positionnels RoPE standard et l’attention Softmax, mais y ajoute un mécanisme d’atténuation entraînable qui détermine quels tokens supprimer pendant l’inférence. Cette méthode réduit le cache clé-valeur — la mémoire utilisée par les grands modèles de langage — sans nuire à la précision. Les tests montrent une réduction par 10 de la taille du cache sur des données courantes et par 25 lors du traitement d’entrées de 16,000 tokens, tout en améliorant les performances sur les tâches en aval.

Pourquoi c'est important

Un cache plus petit permet de déployer les grands modèles de langage à moindre coût et plus rapidement sur des appareils à mémoire limitée.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.