# Слой памяти ускоряет и удешевляет работу с контекстом в 50 млн токенов

> Пакет galahad‑kv хранит состояние KV на зашифрованном NVMe-накопителе, сокращая вычислительное время в 2,8–4,3 раза, а энергопотребление — в 8,8–12,3 раза.

Oossa · 2026-10-09 · https://oossa.com/ru/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Исследователи представили общедоступный слой памяти galahad‑kv, который сохраняет состояние ключей и значений языковой модели на локальном зашифрованном NVMe-накопителе. Благодаря этому модель может повторно загрузить блок из 16 000 токенов, не вычисляя его заново. Испытания на одном NVIDIA H100 с моделями Gemma 4 12B и 31B показали, что обработка потока объёмом 50 млн токенов ускорилась в 2,8–4,3 раза, а энергопотребление GPU снизилось в 8,8–12,3 раза. Модель 31B верно отвечала на фактические вопросы о ранее упомянутом в тексте в 98 % случаев.

## Факты

- Слой памяти хранит состояние KV для блоков по 16 000 токенов на зашифрованном NVMe-накопителе.
- Загрузка блока была в 2,8–4,3 раза быстрее и потребляла в 8,8–12,3 раза меньше энергии GPU.

## Почему это важно

Это позволяет разработчикам запускать приложения с очень длинным контекстом на одном GPU, сокращая расходы и энергопотребление.

## Источники и ссылки

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Обновлено: 2026-10-09
