Une équipe dirigée par Ahan Gupta a présenté une nouvelle architecture baptisée Universal Attention. Elle conserve les embeddings positionnels RoPE standard et l’attention Softmax, mais y ajoute un mécanisme d’atténuation entraînable qui détermine quels tokens supprimer pendant l’inférence. Cette méthode réduit le cache clé-valeur — la mémoire utilisée par les grands modèles de langage — sans nuire à la précision. Les tests montrent une réduction par 10 de la taille du cache sur des données courantes et par 25 lors du traitement d’entrées de 16,000 tokens, tout en améliorant les performances sur les tâches en aval.
Pourquoi c'est important
Un cache plus petit permet de déployer les grands modèles de langage à moindre coût et plus rapidement sur des appareils à mémoire limitée.