ggml‑org/llama.cpp 프로젝트가 2026-10-09에 버전 b11530을 공개했습니다. 이번 변경으로 ubatch 간 백엔드 샘플링 그래프가 고정돼 reserve 및 decode 단계에서 그래프 형태가 더는 바뀌지 않습니다. reserve 빌드 후 그래프 토폴로지가 달라질 때 발생하던 충돌을 해결합니다. 이 수정 사항은 macOS, Linux, Android, Windows, openEuler 등 명시된 모든 빌드와 CUDA, Vulkan, OpenCL 등 모든 하드웨어 백엔드에 적용됩니다.
왜 중요한가
llama.cpp를 사용하는 개발자는 지원되는 CPU나 GPU에서 다중 출력 생성을 실행할 때 런타임 오류를 덜 겪게 됩니다.