Oossa

llama.cpp v0.1.11534 optimiza las copias en CUDA

La biblioteca de inferencia LLaMA de código abierto elimina transferencias redundantes de memoria en la GPU, lo que reduce la sobrecarga en ciertas cargas de trabajo.

BrevePor Publicado por Oossa: 1 min de lectura

El equipo de ggml-org publicó la versión b11534 de llama.cpp el 2026-10-09. La actualización integra las copias de instantáneas de estado en la caché recurrente y elimina copias adicionales en CUDA cuando K = 1, un caso de decodificación sin especulación. El cambio se limita al backend de CUDA, por lo que las compilaciones para CPU y Vulkan no cambian. Hay binarios precompilados disponibles para descargar para macOS, iOS y varias versiones de Ubuntu.

Quienes usen la versión con CUDA deberían notar una ligera reducción del tráfico de memoria de la GPU, lo que puede mejorar la velocidad en el hardware compatible.

Por qué importa

Quienes usan CUDA podrían obtener inferencias más rápidas porque la biblioteca ahora mueve menos datos en la GPU.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.