Исследователи представили общедоступный слой памяти galahad‑kv, который сохраняет состояние ключей и значений языковой модели на локальном зашифрованном NVMe-накопителе. Благодаря этому модель может повторно загрузить блок из 16 000 токенов, не вычисляя его заново. Испытания на одном NVIDIA H100 с моделями Gemma 4 12B и 31B показали, что обработка потока объёмом 50 млн токенов ускорилась в 2,8–4,3 раза, а энергопотребление GPU снизилось в 8,8–12,3 раза. Модель 31B верно отвечала на фактические вопросы о ранее упомянутом в тексте в 98 % случаев.
Почему это важно
Это позволяет разработчикам запускать приложения с очень длинным контекстом на одном GPU, сокращая расходы и энергопотребление.