# 메모리 계층으로 5천만 토큰 문맥을 더 빠르고 저렴하게 처리

> galahad‑kv 패키지는 KV 상태를 암호화된 NVMe에 저장해 긴 텍스트 처리 시간을 2.8‑4.3배 줄이고 에너지를 8.8‑12.3배 절감합니다.

Oossa · 2026-10-09 · https://oossa.com/ko/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

연구진이 galahad‑kv라는 공개 메모리 계층을 출시했습니다. 이 계층은 언어 모델의 키-값(KV) 상태를 암호화된 로컬 NVMe 디스크에 저장합니다. 덕분에 모델은 16,000토큰 블록을 다시 계산하지 않고 불러올 수 있습니다. NVIDIA H100 한 대에서 Gemma 4 12B 및 31B 모델로 테스트한 결과, 5천만 토큰 스트림을 처리할 때 블록을 불러오는 속도는 2.8‑4.3배 빨랐고 GPU 에너지 사용량은 8.8‑12.3배 적었습니다. 31B 모델은 텍스트 앞부분에 나온 사실을 묻는 질문에 98%의 정확도로 답했습니다.

## 팩트

- 메모리 계층은 16,000토큰 블록의 KV 상태를 암호화된 NVMe에 저장합니다.
- 블록을 불러오는 속도는 2.8×‑4.3× 빨랐고 GPU 에너지 사용량은 8.8×‑12.3× 적었습니다.

## 왜 중요한가

개발자는 GPU 한 대로 긴 문맥을 활용하는 애플리케이션을 구동해 비용과 전력 사용량을 줄일 수 있습니다.

## 출처 및 참고 자료

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

최종 업데이트: 2026-10-09
