Oossa

Una capa de memoria acelera y abarata la reutilización de contextos de 50 millones de tokens

El paquete galahad‑kv guarda el estado KV en una unidad NVMe local cifrada y reduce el tiempo de cómputo entre 2,8 y 4,3 veces, y el consumo de energía entre 8,8 y 12,3 veces, al procesar textos largos.

BrevePor Publicado por Oossa: 1 min de lectura

Un grupo de investigadores publicó galahad‑kv, una capa de memoria que guarda el estado de clave-valor de un modelo de lenguaje en un disco NVMe local cifrado. Así, el modelo puede volver a cargar un bloque de 16.000 tokens sin tener que recalcularlo. En pruebas realizadas con una sola NVIDIA H100 y los modelos Gemma 4 12B y 31B, la carga fue entre 2,8 y 4,3 veces más rápida y consumió entre 8,8 y 12,3 veces menos energía de la GPU a lo largo de un flujo de 50 millones de tokens. El modelo 31B respondió correctamente el 98 % de las veces a preguntas sobre datos mencionados antes en el texto.

Por qué importa

Permite a los desarrolladores ejecutar aplicaciones con contextos muy extensos en una sola GPU, con menos costos y consumo de energía.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.