Oossa

La memoria riutilizza più rapidamente e a minor costo contesti da 50 milioni di token

Il pacchetto galahad‑kv salva lo stato KV su un’unità NVMe locale cifrata, riducendo i tempi di calcolo di 2,8‑4,3× e il consumo energetico di 8,8‑12,3× sui testi lunghi.

BreveDi Pubblicato da Oossa: 1 min di lettura

I ricercatori hanno reso disponibile al pubblico galahad‑kv, un livello di memoria che salva lo stato key-value di un modello linguistico su un’unità NVMe locale cifrata. In questo modo il modello può ricaricare un blocco da 16.000 token senza doverlo ricalcolare. Nei test condotti su una singola NVIDIA H100 con i modelli Gemma 4 12B e 31B, il caricamento è risultato 2,8‑4,3 volte più veloce e ha richiesto 8,8‑12,3 volte meno energia della GPU lungo un flusso da 50 milioni di token. Il modello 31B ha risposto correttamente nel 98% dei casi a domande fattuali su parti precedenti del testo.

Perché conta

Consente agli sviluppatori di eseguire applicazioni con contesti molto lunghi su una sola GPU, riducendo costi e consumi energetici.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.