El equipo de ggml-org publicó llama.cpp b11496 el 8 de octubre de 2026. La actualización incorpora una etapa SYCL que transfiere cargas masivas de modelos mediante un búfer circular fijado en memoria, lo que acelera la carga en las GPU compatibles. Ya se pueden descargar binarios para macOS (Apple Silicon e Intel), iOS y varias versiones de Ubuntu (CPU, Vulkan y CUDA 12).
Por qué importa
Los desarrolladores pueden cargar modelos de lenguaje grandes más rápido en hardware compatible con SYCL, lo que reduce el tiempo de inicio de las aplicaciones que usan llama.cpp.