Oossa

Camada de memória acelera e barateia o uso de contexto de 50 milhões de tokens em IA

O pacote galahad‑kv armazena estados KV em um NVMe local criptografado, reduzindo o tempo de computação em 2,8 a 4,3 vezes e o consumo de energia em 8,8 a 12,3 vezes em textos longos.

NotaPor Publicado pelo Oossa: 1 min de leitura

Pesquisadores lançaram uma camada pública de memória chamada galahad‑kv, que salva em um disco NVMe local criptografado o estado de chave e valor de um modelo de linguagem. Assim, o modelo pode recarregar um bloco de 16.000 tokens sem precisar recalculá-lo. Em testes com uma única NVIDIA H100 e os modelos Gemma 4 12B e 31B, o carregamento foi de 2,8 a 4,3 vezes mais rápido e consumiu de 8,8 a 12,3 vezes menos energia da GPU ao longo de um fluxo de 50 milhões de tokens. O modelo 31B respondeu corretamente a perguntas factuais sobre trechos anteriores do texto em 98% dos casos.

Por que importa

Isso permite que desenvolvedores executem aplicações com contexto muito longo em uma única GPU, reduzindo custos e consumo de energia.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.