El equipo de ggml‑org publicó la versión b11515 de llama.cpp el 2026‑10‑09. La actualización incorpora una multiplicación matriz‑vector cuantizada (MMVQ) con disposición reordenada Q5_K basada en SYCL y un operador GLU fusionado, que mejoran el rendimiento en hardware compatible. También incluye binarios listos para usar en Apple Silicon, Mac con procesadores Intel, iOS, Ubuntu (CPU, Vulkan, CUDA 12.8) e IBM s390x. Los usuarios pueden descargar el archivo correspondiente desde la página de GitHub.
Por qué importa
Los desarrolladores ya pueden ejecutar llama.cpp más rápido en GPU compatibles con SYCL sin tener que compilarlo desde el código fuente.