Oossa

Трансформер сам сокращает KV-кэш до 25 раз

Исследователи представили Universal Attention — обучаемый метод, который адаптивно удаляет малозначимые токены. Он сжимает кэш в 10 раз на типичных задачах и в 25 раз при обработке последовательностей длиной 16k токенов.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда под руководством Ahan Gupta представила новую архитектуру Universal Attention. Она сохраняет стандартные позиционные эмбеддинги RoPE и механизм внимания Softmax, но добавляет обучаемый механизм затухания, который во время инференса определяет, какие токены можно отбросить. Метод сокращает кэш ключей и значений — память, используемую большими языковыми моделями, — без потери точности. Испытания показали, что на обычных данных размер кэша уменьшается в 10 раз, а при обработке входных данных длиной 16,000 токенов — в 25 раз; при этом качество на последующих задачах даже улучшается.

Почему это важно

Меньший кэш снижает стоимость и ускоряет запуск больших языковых моделей на устройствах с ограниченной памятью.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.