Oossa

llama.cpp b11510 amplía el soporte de CUDA para tensores grandes

La biblioteca de inferencia LLaMA de código abierto publica la versión b11510, que incluye un nuevo kernel de CUDA capaz de procesar más de 65.535 filas, además de binarios para macOS, iOS y Linux.

BrevePor Publicado por Oossa: 1 min de lectura

El equipo de ggml-org publicó llama.cpp versión b11510 el 8 de octubre de 2026. La versión incorpora un kernel PAD con bucles para CUDA, que permite a la biblioteca procesar tensores con más de 65.000 filas o secciones. También incluye binarios precompilados para Apple Silicon, macOS con Intel, iOS y varias versiones de Ubuntu (CPU, Vulkan y CUDA 12.8). El código y las declaraciones de procedencia están enlazados desde la página de GitHub.

Por qué importa

Los desarrolladores ahora pueden ejecutar modelos de lenguaje más grandes en GPU NVIDIA sin alcanzar el límite anterior de filas.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.