# Трансформер сам сокращает KV-кэш до 25 раз

> Исследователи представили Universal Attention — обучаемый метод, который адаптивно удаляет малозначимые токены. Он сжимает кэш в 10 раз на типичных задачах и в 25 раз при обработке последовательностей длиной 16k токенов.

Oossa · 2026-10-08 · https://oossa.com/ru/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Команда под руководством Ahan Gupta представила новую архитектуру Universal Attention. Она сохраняет стандартные позиционные эмбеддинги RoPE и механизм внимания Softmax, но добавляет обучаемый механизм затухания, который во время инференса определяет, какие токены можно отбросить. Метод сокращает кэш ключей и значений — память, используемую большими языковыми моделями, — без потери точности. Испытания показали, что на обычных данных размер кэша уменьшается в 10 раз, а при обработке входных данных длиной 16,000 токенов — в 25 раз; при этом качество на последующих задачах даже улучшается.

## Факты

- Сжатие KV-кэша в 10 раз на задачах обработки естественного языка
- Сжатие в 25 раз при длине последовательности 16k токенов

## Почему это важно

Меньший кэш снижает стоимость и ускоряет запуск больших языковых моделей на устройствах с ограниченной памятью.

## Источники и ссылки

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

Обновлено: 2026-10-08
