# Una capa de memoria acelera y abarata la reutilización de contextos de 50 millones de tokens

> El paquete galahad‑kv guarda el estado KV en una unidad NVMe local cifrada y reduce el tiempo de cómputo entre 2,8 y 4,3 veces, y el consumo de energía entre 8,8 y 12,3 veces, al procesar textos largos.

Oossa · 2026-10-09 · https://oossa.com/es/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Un grupo de investigadores publicó galahad‑kv, una capa de memoria que guarda el estado de clave-valor de un modelo de lenguaje en un disco NVMe local cifrado. Así, el modelo puede volver a cargar un bloque de 16.000 tokens sin tener que recalcularlo. En pruebas realizadas con una sola NVIDIA H100 y los modelos Gemma 4 12B y 31B, la carga fue entre 2,8 y 4,3 veces más rápida y consumió entre 8,8 y 12,3 veces menos energía de la GPU a lo largo de un flujo de 50 millones de tokens. El modelo 31B respondió correctamente el 98 % de las veces a preguntas sobre datos mencionados antes en el texto.

## Los hechos

- La capa de memoria guarda el estado KV de bloques de 16.000 tokens en una unidad NVMe cifrada.
- La carga de un bloque fue entre 2,8 y 4,3 veces más rápida y consumió entre 8,8 y 12,3 veces menos energía de la GPU.

## Por qué importa

Permite a los desarrolladores ejecutar aplicaciones con contextos muy extensos en una sola GPU, con menos costos y consumo de energía.

## Fuentes y referencias

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Última actualización: 2026-10-09
