ggml‑org/llama.cpp 프로젝트가 2026-10-02에 버전 b11351을 출시했다. 이번 업데이트에서는 ggml_backend_buffer_type_i 인터페이스에 alloc_buffer_n 메서드를 추가하고, 공개 API인 ggml_backend_buft_alloc_buffer_n을 제공한다. 기본 구현은 이제 여러 장치에 걸쳐 버퍼를 분할하고 텐서를 더 효율적으로 할당할 수 있다. CPU, Metal, OpenVINO 등 기존 버퍼 유형에는 새 메서드의 자리 표시자로 NULL이 추가됐다. 새 기능을 검증하는 테스트도 추가됐다.
왜 중요한가
개발자는 이제 다양한 하드웨어에서 메모리를 더 안정적으로 관리해 AI 모델의 할당 오류를 줄일 수 있다.