# Une mémoire permet à l’IA de réutiliser plus vite un contexte de 50 millions de tokens

> Le paquet galahad‑kv stocke l’état KV sur un NVMe local chiffré, réduisant le temps de calcul de 2,8 à 4,3 fois et la consommation d’énergie de 8,8 à 12,3 fois pour les textes longs.

Oossa · 2026-10-09 · https://oossa.com/fr/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Des chercheurs ont mis à disposition une couche mémoire publique appelée galahad‑kv, qui enregistre l’état clé‑valeur d’un modèle de langage sur un disque NVMe local chiffré. Le modèle peut ainsi recharger un bloc de 16 000 tokens sans le recalculer. Des tests menés sur un seul NVIDIA H100 avec les modèles Gemma 4 12B et 31B ont montré que le chargement était 2,8 à 4,3 fois plus rapide et consommait 8,8 à 12,3 fois moins d’énergie GPU sur un flux de 50 millions de tokens. Le modèle 31B a répondu correctement à des questions factuelles portant sur des passages antérieurs du texte dans 98 % des cas.

## Les faits

- La couche mémoire stocke l’état KV de blocs de 16 000 tokens sur un NVMe chiffré.
- Le chargement d’un bloc était 2,8 à 4,3 fois plus rapide et consommait 8,8 à 12,3 fois moins d’énergie GPU.

## Pourquoi c'est important

Les développeurs peuvent ainsi exécuter sur un seul GPU des applications exploitant un très long contexte, tout en réduisant les coûts et la consommation d’énergie.

## Sources et références

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Dernière mise à jour: 2026-10-09
