Oossa

Слой памяти ускоряет и удешевляет работу с контекстом в 50 млн токенов

Пакет galahad‑kv хранит состояние KV на зашифрованном NVMe-накопителе, сокращая вычислительное время в 2,8–4,3 раза, а энергопотребление — в 8,8–12,3 раза.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Исследователи представили общедоступный слой памяти galahad‑kv, который сохраняет состояние ключей и значений языковой модели на локальном зашифрованном NVMe-накопителе. Благодаря этому модель может повторно загрузить блок из 16 000 токенов, не вычисляя его заново. Испытания на одном NVIDIA H100 с моделями Gemma 4 12B и 31B показали, что обработка потока объёмом 50 млн токенов ускорилась в 2,8–4,3 раза, а энергопотребление GPU снизилось в 8,8–12,3 раза. Модель 31B верно отвечала на фактические вопросы о ранее упомянутом в тексте в 98 % случаев.

Почему это важно

Это позволяет разработчикам запускать приложения с очень длинным контекстом на одном GPU, сокращая расходы и энергопотребление.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.