# La memoria riutilizza più rapidamente e a minor costo contesti da 50 milioni di token

> Il pacchetto galahad‑kv salva lo stato KV su un’unità NVMe locale cifrata, riducendo i tempi di calcolo di 2,8‑4,3× e il consumo energetico di 8,8‑12,3× sui testi lunghi.

Oossa · 2026-10-09 · https://oossa.com/it/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

I ricercatori hanno reso disponibile al pubblico galahad‑kv, un livello di memoria che salva lo stato key-value di un modello linguistico su un’unità NVMe locale cifrata. In questo modo il modello può ricaricare un blocco da 16.000 token senza doverlo ricalcolare. Nei test condotti su una singola NVIDIA H100 con i modelli Gemma 4 12B e 31B, il caricamento è risultato 2,8‑4,3 volte più veloce e ha richiesto 8,8‑12,3 volte meno energia della GPU lungo un flusso da 50 milioni di token. Il modello 31B ha risposto correttamente nel 98% dei casi a domande fattuali su parti precedenti del testo.

## I fatti

- Il livello di memoria salva su un’unità NVMe cifrata lo stato KV relativo a blocchi da 16.000 token.
- Il caricamento di un blocco è risultato 2,8×‑4,3× più veloce e ha richiesto 8,8×‑12,3× meno energia della GPU.

## Perché conta

Consente agli sviluppatori di eseguire applicazioni con contesti molto lunghi su una sola GPU, riducendo costi e consumi energetici.

## Fonti e riferimenti

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Ultimo aggiornamento: 2026-10-09
