Команда под руководством Ahan Gupta представила новую архитектуру Universal Attention. Она сохраняет стандартные позиционные эмбеддинги RoPE и механизм внимания Softmax, но добавляет обучаемый механизм затухания, который во время инференса определяет, какие токены можно отбросить. Метод сокращает кэш ключей и значений — память, используемую большими языковыми моделями, — без потери точности. Испытания показали, что на обычных данных размер кэша уменьшается в 10 раз, а при обработке входных данных длиной 16,000 токенов — в 25 раз; при этом качество на последующих задачах даже улучшается.
Почему это важно
Меньший кэш снижает стоимость и ускоряет запуск больших языковых моделей на устройствах с ограниченной памятью.