# llama.cpp b11494 optimiza el uso de CUDA por warp

> La biblioteca de código abierto llama.cpp ahora asigna cuatro columnas de estado GDN a cada warp de CUDA para mejorar el rendimiento de la GPU.

Oossa · 2026-10-08 · https://oossa.com/es/llama-cpp-release-b11494-adds-cuda-warp-optimizations

El equipo de ggml-org publicó la versión b11494 de llama.cpp. La actualización modifica el backend de CUDA para asignar cuatro columnas de estado GDN por warp, en lugar de dos. Este ajuste ahora viene activado de forma predeterminada. Se pueden descargar binarios para macOS (Apple Silicon e Intel), iOS y varias versiones de Ubuntu.

## Los hechos

- La etiqueta de lanzamiento b11494 se publicó el 2026-10-08
- El valor predeterminado de cols_per_warp en CUDA se fijó en 4

## Por qué importa

Los desarrolladores que usan llama.cpp en GPU NVIDIA pueden esperar una inferencia más rápida sin cambiar su código.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

Última actualización: 2026-10-08
