Oossa

메모리 계층으로 5천만 토큰 문맥을 더 빠르고 저렴하게 처리

galahad‑kv 패키지는 KV 상태를 암호화된 NVMe에 저장해 긴 텍스트 처리 시간을 2.8‑4.3배 줄이고 에너지를 8.8‑12.3배 절감합니다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

연구진이 galahad‑kv라는 공개 메모리 계층을 출시했습니다. 이 계층은 언어 모델의 키-값(KV) 상태를 암호화된 로컬 NVMe 디스크에 저장합니다. 덕분에 모델은 16,000토큰 블록을 다시 계산하지 않고 불러올 수 있습니다. NVIDIA H100 한 대에서 Gemma 4 12B 및 31B 모델로 테스트한 결과, 5천만 토큰 스트림을 처리할 때 블록을 불러오는 속도는 2.8‑4.3배 빨랐고 GPU 에너지 사용량은 8.8‑12.3배 적었습니다. 31B 모델은 텍스트 앞부분에 나온 사실을 묻는 질문에 98%의 정확도로 답했습니다.

왜 중요한가

개발자는 GPU 한 대로 긴 문맥을 활용하는 애플리케이션을 구동해 비용과 전력 사용량을 줄일 수 있습니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.