Des chercheurs ont mis à disposition une couche mémoire publique appelée galahad‑kv, qui enregistre l’état clé‑valeur d’un modèle de langage sur un disque NVMe local chiffré. Le modèle peut ainsi recharger un bloc de 16 000 tokens sans le recalculer. Des tests menés sur un seul NVIDIA H100 avec les modèles Gemma 4 12B et 31B ont montré que le chargement était 2,8 à 4,3 fois plus rapide et consommait 8,8 à 12,3 fois moins d’énergie GPU sur un flux de 50 millions de tokens. Le modèle 31B a répondu correctement à des questions factuelles portant sur des passages antérieurs du texte dans 98 % des cas.
Pourquoi c'est important
Les développeurs peuvent ainsi exécuter sur un seul GPU des applications exploitant un très long contexte, tout en réduisant les coûts et la consommation d’énergie.