# Transformador que se poda reduz o cache KV em até 25×

> Pesquisadores apresentam a Universal Attention, um método treinável que remove de forma adaptativa tokens de baixo impacto e comprime o cache em 10× em tarefas típicas e em 25× com sequências de 16 mil tokens.

Oossa · 2026-10-08 · https://oossa.com/pt/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Uma equipe liderada por Ahan Gupta apresentou uma nova arquitetura chamada Universal Attention. Ela mantém os embeddings posicionais RoPE e a atenção Softmax padrão, mas acrescenta um mecanismo de decaimento treinável que decide quais tokens descartar durante a inferência. O método poda o cache de chave e valor — a memória usada por grandes modelos de linguagem — sem prejudicar a precisão. Os testes mostram uma redução de dez vezes no tamanho do cache em dados comuns e de vinte e cinco vezes no processamento de entradas com 16.000 tokens, além de melhorar o desempenho em tarefas subsequentes.

## Os fatos

- Compressão de 10× do cache KV em tarefas de linguagem natural
- Compressão de 25× com sequências de 16 mil tokens

## Por que importa

A necessidade de um cache menor pode tornar a implantação de grandes modelos de linguagem mais barata e rápida em dispositivos com memória limitada.

## Fontes e referências

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Última atualização: 2026-10-08
