La biblioteca llama.cpp publicó la versión b11559 el 11 de octubre de 2026. Incluye mejoras de OpenCL para acelerar la asignación de factores y permite decodificar Gemma‑4 en las GPU Qualcomm E4B y E2B. La actualización también optimiza las rutas de decodificación DK64 y DK128 para distintas configuraciones de cuantización. Hongqiang Wang, de Qualcomm, fue coautor de los cambios.
Por qué importa
Los desarrolladores ahora pueden ejecutar modelos Gemma‑4 más rápido en GPU Qualcomm compatibles, lo que amplía las posibilidades de la IA en el borde.