Oossa

Une mémoire permet à l’IA de réutiliser plus vite un contexte de 50 millions de tokens

Le paquet galahad‑kv stocke l’état KV sur un NVMe local chiffré, réduisant le temps de calcul de 2,8 à 4,3 fois et la consommation d’énergie de 8,8 à 12,3 fois pour les textes longs.

BrèvePar Publié par Oossa: 1 min de lecture

Des chercheurs ont mis à disposition une couche mémoire publique appelée galahad‑kv, qui enregistre l’état clé‑valeur d’un modèle de langage sur un disque NVMe local chiffré. Le modèle peut ainsi recharger un bloc de 16 000 tokens sans le recalculer. Des tests menés sur un seul NVIDIA H100 avec les modèles Gemma 4 12B et 31B ont montré que le chargement était 2,8 à 4,3 fois plus rapide et consommait 8,8 à 12,3 fois moins d’énergie GPU sur un flux de 50 millions de tokens. Le modèle 31B a répondu correctement à des questions factuelles portant sur des passages antérieurs du texte dans 98 % des cas.

Pourquoi c'est important

Les développeurs peuvent ainsi exécuter sur un seul GPU des applications exploitant un très long contexte, tout en réduisant les coûts et la consommation d’énergie.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.