# llama.cpp v0.1.11534 optimiza las copias en CUDA

> La biblioteca de inferencia LLaMA de código abierto elimina transferencias redundantes de memoria en la GPU, lo que reduce la sobrecarga en ciertas cargas de trabajo.

Oossa · 2026-10-09 · https://oossa.com/es/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

El equipo de ggml-org publicó la versión b11534 de llama.cpp el 2026-10-09. La actualización integra las copias de instantáneas de estado en la caché recurrente y elimina copias adicionales en CUDA cuando K = 1, un caso de decodificación sin especulación. El cambio se limita al backend de CUDA, por lo que las compilaciones para CPU y Vulkan no cambian. Hay binarios precompilados disponibles para descargar para macOS, iOS y varias versiones de Ubuntu.

Quienes usen la versión con CUDA deberían notar una ligera reducción del tráfico de memoria de la GPU, lo que puede mejorar la velocidad en el hardware compatible.

## Los hechos

- La versión b11534 se publicó el 2026-10-09
- La eliminación de copias en CUDA se aplica cuando K = 1 (caso sin decodificación especulativa)

## Por qué importa

Quienes usan CUDA podrían obtener inferencias más rápidas porque la biblioteca ahora mueve menos datos en la GPU.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Última actualización: 2026-10-09
