El proyecto llama.cpp publicó la versión b11554 el 2026‑10‑11. La actualización incorpora ajustes específicos para Vulkan que detectan IDs de fila duplicados en las multiplicaciones de matrices y los procesan en una pasada previa, en lugar de hacerlo dentro de un bucle. También mejora la optimización «hoist row ids» para que se ejecute siempre y pueda generar varios bloques compactos. Estos cambios permiten que la GPU lance menos grupos de trabajo y finalice antes cuando es posible.
Por qué importa
Quienes usan llama.cpp en una GPU pueden obtener una inferencia más rápida, porque la biblioteca evita repetir los mismos cálculos.