ggml-org/llama.cpp 프로젝트가 2026년 10월 3일 버전 b11372를 출시했다. 이번 업데이트에서는 Qwen4exp 인덱서를 다시 작성해 각 헤드가 점수를 개별적으로 계산하고 결과를 제자리에서 기록하도록 했다. 장문 컨텍스트 그래프에서 메모리를 가장 많이 차지하던 인덱서 점수 버퍼에 필요한 메모리가 절반으로 줄었다. 연산 속도에는 영향이 없으며, CUDA, Metal, Vulkan 백엔드에서 새로운 lightning 인덱서도 지원한다.
왜 중요한가
장문 컨텍스트로 대규모 언어 모델을 실행하는 개발자는 같은 하드웨어에서 더 긴 프롬프트를 처리할 수 있다.