Un equipo dirigido por Ahan Gupta presentó una nueva arquitectura llamada Universal Attention. Mantiene las codificaciones posicionales RoPE estándar y la atención Softmax, pero incorpora un mecanismo de decaimiento entrenable que decide qué tokens descartar durante la inferencia. El método poda la caché de claves y valores —la memoria que utilizan los modelos de lenguaje grandes— sin perjudicar la precisión. Las pruebas muestran una reducción de diez veces en el tamaño de la caché con datos habituales y de veinticinco veces al procesar entradas de 16,000 tokens, al tiempo que mejora el rendimiento en tareas posteriores.
Por qué importa
Una caché más pequeña permite implementar modelos de lenguaje grandes de forma más barata y rápida en dispositivos con memoria limitada.