연구진이 galahad‑kv라는 공개 메모리 계층을 출시했습니다. 이 계층은 언어 모델의 키-값(KV) 상태를 암호화된 로컬 NVMe 디스크에 저장합니다. 덕분에 모델은 16,000토큰 블록을 다시 계산하지 않고 불러올 수 있습니다. NVIDIA H100 한 대에서 Gemma 4 12B 및 31B 모델로 테스트한 결과, 5천만 토큰 스트림을 처리할 때 블록을 불러오는 속도는 2.8‑4.3배 빨랐고 GPU 에너지 사용량은 8.8‑12.3배 적었습니다. 31B 모델은 텍스트 앞부분에 나온 사실을 묻는 질문에 98%의 정확도로 답했습니다.
왜 중요한가
개발자는 GPU 한 대로 긴 문맥을 활용하는 애플리케이션을 구동해 비용과 전력 사용량을 줄일 수 있습니다.