# Camada de memória acelera e barateia o uso de contexto de 50 milhões de tokens em IA

> O pacote galahad‑kv armazena estados KV em um NVMe local criptografado, reduzindo o tempo de computação em 2,8 a 4,3 vezes e o consumo de energia em 8,8 a 12,3 vezes em textos longos.

Oossa · 2026-10-09 · https://oossa.com/pt/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Pesquisadores lançaram uma camada pública de memória chamada galahad‑kv, que salva em um disco NVMe local criptografado o estado de chave e valor de um modelo de linguagem. Assim, o modelo pode recarregar um bloco de 16.000 tokens sem precisar recalculá-lo. Em testes com uma única NVIDIA H100 e os modelos Gemma 4 12B e 31B, o carregamento foi de 2,8 a 4,3 vezes mais rápido e consumiu de 8,8 a 12,3 vezes menos energia da GPU ao longo de um fluxo de 50 milhões de tokens. O modelo 31B respondeu corretamente a perguntas factuais sobre trechos anteriores do texto em 98% dos casos.

## Os fatos

- A camada de memória armazena estados KV de blocos de 16.000 tokens em um NVMe criptografado.
- O carregamento de um bloco foi de 2,8 a 4,3 vezes mais rápido e consumiu de 8,8 a 12,3 vezes menos energia da GPU.

## Por que importa

Isso permite que desenvolvedores executem aplicações com contexto muito longo em uma única GPU, reduzindo custos e consumo de energia.

## Fontes e referências

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Última atualização: 2026-10-09
