La biblioteca llama.cpp publicó una nueva versión (b11374) el 3 de oct. de 2026. Esta actualiza el backend de OpenVINO a la versión 2026.4.1, incorpora una nueva fusión de convoluciones, corrige errores en los búferes de GPU y ajusta el manejo de ejes para los modelos de mezcla de expertos (MoE). Los cambios aceleran la generación de tokens en modelos MoE fusionados y evitan cierres inesperados en algunas GPU Intel.
Por qué importa
Los desarrolladores que usan llama.cpp en GPU Intel ahora pueden aprovechar OpenVINO con mayor velocidad y menos cierres inesperados.