# llama.cpp optimiza el procesamiento de filas duplicadas en Vulkan

> La biblioteca de inferencia LLaMA de código abierto evita trabajo redundante cuando se repiten filas en la GPU, lo que mejora la velocidad en dispositivos Vulkan.

Oossa · 2026-10-11 · https://oossa.com/es/llama-cpp-adds-vulkan-duplicate-row-optimizations

El proyecto llama.cpp publicó la versión b11554 el 2026‑10‑11. La actualización incorpora ajustes específicos para Vulkan que detectan IDs de fila duplicados en las multiplicaciones de matrices y los procesan en una pasada previa, en lugar de hacerlo dentro de un bucle. También mejora la optimización «hoist row ids» para que se ejecute siempre y pueda generar varios bloques compactos. Estos cambios permiten que la GPU lance menos grupos de trabajo y finalice antes cuando es posible.

## Los hechos

- La versión b11554 se publicó el dom. 11 de oct. de 2026
- llama.cpp incorpora el procesamiento de filas duplicadas en Vulkan

## Por qué importa

Quienes usan llama.cpp en una GPU pueden obtener una inferencia más rápida, porque la biblioteca evita repetir los mismos cálculos.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

Última actualización: 2026-10-11
