Uma equipe liderada por Ahan Gupta apresentou uma nova arquitetura chamada Universal Attention. Ela mantém os embeddings posicionais RoPE e a atenção Softmax padrão, mas acrescenta um mecanismo de decaimento treinável que decide quais tokens descartar durante a inferência. O método poda o cache de chave e valor — a memória usada por grandes modelos de linguagem — sem prejudicar a precisão. Os testes mostram uma redução de dez vezes no tamanho do cache em dados comuns e de vinte e cinco vezes no processamento de entradas com 16.000 tokens, além de melhorar o desempenho em tarefas subsequentes.
Por que importa
A necessidade de um cache menor pode tornar a implantação de grandes modelos de linguagem mais barata e rápida em dispositivos com memória limitada.