El equipo de ggml-org publicó la versión b11528 de llama.cpp el 2026-10-09. La actualización permite que la biblioteca trate las vistas de tensores asignados en el host como nodos normales, lo que evita un error de aserción que se producía al usar la opción –split-mode tensor. También restablece la compatibilidad con los tensores SM del acelerador K2 Horizon. El cambio está incluido en la versión oficial de GitHub y se aplica a todas las plataformas indicadas, desde macOS hasta Windows y Linux.
Por qué importa
Los desarrolladores ya pueden ejecutar llama.cpp con la caché KV dividida en más hardware y sin fallos, lo que amplía las configuraciones disponibles para la inferencia local de modelos de lenguaje grandes.