Pesquisadores lançaram uma camada pública de memória chamada galahad‑kv, que salva em um disco NVMe local criptografado o estado de chave e valor de um modelo de linguagem. Assim, o modelo pode recarregar um bloco de 16.000 tokens sem precisar recalculá-lo. Em testes com uma única NVIDIA H100 e os modelos Gemma 4 12B e 31B, o carregamento foi de 2,8 a 4,3 vezes mais rápido e consumiu de 8,8 a 12,3 vezes menos energia da GPU ao longo de um fluxo de 50 milhões de tokens. O modelo 31B respondeu corretamente a perguntas factuais sobre trechos anteriores do texto em 98% dos casos.
Por que importa
Isso permite que desenvolvedores executem aplicações com contexto muito longo em uma única GPU, reduzindo custos e consumo de energia.