# llama.cpp b11510 amplía el soporte de CUDA para tensores grandes

> La biblioteca de inferencia LLaMA de código abierto publica la versión b11510, que incluye un nuevo kernel de CUDA capaz de procesar más de 65.535 filas, además de binarios para macOS, iOS y Linux.

Oossa · 2026-10-08 · https://oossa.com/es/llama-cpp-b11510-adds-cuda-support-for-larger-tensors

El equipo de ggml-org publicó llama.cpp versión b11510 el 8 de octubre de 2026. La versión incorpora un kernel PAD con bucles para CUDA, que permite a la biblioteca procesar tensores con más de 65.000 filas o secciones. También incluye binarios precompilados para Apple Silicon, macOS con Intel, iOS y varias versiones de Ubuntu (CPU, Vulkan y CUDA 12.8). El código y las declaraciones de procedencia están enlazados desde la página de GitHub.

## Los hechos

- La versión b11510 se publicó el 2026-10-08
- El nuevo kernel PAD de CUDA admite más de 65535 filas

## Por qué importa

Los desarrolladores ahora pueden ejecutar modelos de lenguaje más grandes en GPU NVIDIA sin alcanzar el límite anterior de filas.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11510](https://github.com/ggml-org/llama.cpp/releases/tag/b11510) – llama.cpp, 2026-10-08

Última actualización: 2026-10-08
