# llama.cpp añade soporte para OpenVINO 2026.4.1 y corrige fallos de MoE

> La actualización del 3 de oct. de 2026 mejora el backend de OpenVINO, el rendimiento y la gestión de modelos MoE en llama.cpp.

Oossa · 2026-10-03 · https://oossa.com/es/llama-cpp-release-adds-openvino-2026-4-1-support-and-moe-fixes

La biblioteca llama.cpp publicó una nueva versión (b11374) el 3 de oct. de 2026. Esta actualiza el backend de OpenVINO a la versión 2026.4.1, incorpora una nueva fusión de convoluciones, corrige errores en los búferes de GPU y ajusta el manejo de ejes para los modelos de mezcla de expertos (MoE). Los cambios aceleran la generación de tokens en modelos MoE fusionados y evitan cierres inesperados en algunas GPU Intel.

## Los hechos

- Fecha de lanzamiento: 3 de oct. de 2026 ("Sat Oct 03 2026 13:51:21 GMT+0200")
- OpenVINO se actualizó a 2026.4.1; la velocidad de generación de tokens de gemma-4-26B pasó de 66 t/s a 1 609 t/s al usar la fusión

## Por qué importa

Los desarrolladores que usan llama.cpp en GPU Intel ahora pueden aprovechar OpenVINO con mayor velocidad y menos cierres inesperados.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11374](https://github.com/ggml-org/llama.cpp/releases/tag/b11374) – llama.cpp, 2026-10-03
2. [ggml-org/llama.cpp b11377](https://github.com/ggml-org/llama.cpp/releases/tag/b11377) – llama.cpp, 2026-10-03

Última actualización: 2026-10-03
