Oossa

Transformador que se poda reduz o cache KV em até 25×

Pesquisadores apresentam a Universal Attention, um método treinável que remove de forma adaptativa tokens de baixo impacto e comprime o cache em 10× em tarefas típicas e em 25× com sequências de 16 mil tokens.

NotaPor Publicado pelo Oossa: 1 min de leitura

Uma equipe liderada por Ahan Gupta apresentou uma nova arquitetura chamada Universal Attention. Ela mantém os embeddings posicionais RoPE e a atenção Softmax padrão, mas acrescenta um mecanismo de decaimento treinável que decide quais tokens descartar durante a inferência. O método poda o cache de chave e valor — a memória usada por grandes modelos de linguagem — sem prejudicar a precisão. Os testes mostram uma redução de dez vezes no tamanho do cache em dados comuns e de vinte e cinco vezes no processamento de entradas com 16.000 tokens, além de melhorar o desempenho em tarefas subsequentes.

Por que importa

A necessidade de um cache menor pode tornar a implantação de grandes modelos de linguagem mais barata e rápida em dispositivos com memória limitada.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.