I ricercatori hanno reso disponibile al pubblico galahad‑kv, un livello di memoria che salva lo stato key-value di un modello linguistico su un’unità NVMe locale cifrata. In questo modo il modello può ricaricare un blocco da 16.000 token senza doverlo ricalcolare. Nei test condotti su una singola NVIDIA H100 con i modelli Gemma 4 12B e 31B, il caricamento è risultato 2,8‑4,3 volte più veloce e ha richiesto 8,8‑12,3 volte meno energia della GPU lungo un flusso da 50 milioni di token. Il modello 31B ha risposto correttamente nel 98% dei casi a domande fattuali su parti precedenti del testo.
Perché conta
Consente agli sviluppatori di eseguire applicazioni con contesti molto lunghi su una sola GPU, riducendo costi e consumi energetici.