Un grupo de investigadores publicó galahad‑kv, una capa de memoria que guarda el estado de clave-valor de un modelo de lenguaje en un disco NVMe local cifrado. Así, el modelo puede volver a cargar un bloque de 16.000 tokens sin tener que recalcularlo. En pruebas realizadas con una sola NVIDIA H100 y los modelos Gemma 4 12B y 31B, la carga fue entre 2,8 y 4,3 veces más rápida y consumió entre 8,8 y 12,3 veces menos energía de la GPU a lo largo de un flujo de 50 millones de tokens. El modelo 31B respondió correctamente el 98 % de las veces a preguntas sobre datos mencionados antes en el texto.
Por qué importa
Permite a los desarrolladores ejecutar aplicaciones con contextos muy extensos en una sola GPU, con menos costos y consumo de energía.