El proyecto de código abierto llama.cpp publicó la versión b11558 el 11 de octubre de 2026. La actualización corrige un error que hacía que los kernels de OpenCL superaran los límites de imagen del dispositivo al usar pesos cuantizados Q4_K. También incorpora una ruta alternativa para los dispositivos que alcanzan esos límites y corrige los cálculos de difusión y de normalización RMS en los kernels Q4_0. Hongqiang Wang, de Qualcomm, colaboró en los cambios.
Por qué importa
Los desarrolladores que usan llama.cpp en GPU ahora pueden ejecutar modelos cuantizados Q4_K en más tipos de hardware sin que se produzcan fallos.