Oossa

Un transformer que se poda solo reduce hasta 25× la caché KV

Investigadores presentan Universal Attention, un método entrenable que elimina de forma adaptativa los tokens de bajo impacto y logra una compresión de 10× en tareas habituales y de 25× con secuencias de 16k tokens.

BrevePor Publicado por Oossa: 1 min de lectura

Un equipo dirigido por Ahan Gupta presentó una nueva arquitectura llamada Universal Attention. Mantiene las codificaciones posicionales RoPE estándar y la atención Softmax, pero incorpora un mecanismo de decaimiento entrenable que decide qué tokens descartar durante la inferencia. El método poda la caché de claves y valores —la memoria que utilizan los modelos de lenguaje grandes— sin perjudicar la precisión. Las pruebas muestran una reducción de diez veces en el tamaño de la caché con datos habituales y de veinticinco veces al procesar entradas de 16,000 tokens, al tiempo que mejora el rendimiento en tareas posteriores.

Por qué importa

Una caché más pequeña permite implementar modelos de lenguaje grandes de forma más barata y rápida en dispositivos con memoria limitada.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.