# llama.cpp b11510 prend en charge les grands tenseurs sur CUDA

> La bibliothèque open source d’inférence LLaMA passe à la version b11510. Elle intègre un nouveau noyau CUDA capable de traiter plus de 65 535 lignes, ainsi que des binaires pour macOS, iOS et Linux.

Oossa · 2026-10-08 · https://oossa.com/fr/llama-cpp-b11510-adds-cuda-support-for-larger-tensors

L’équipe ggml‑org a publié llama.cpp version b11510 le 8 oct. 2026. Cette version ajoute à CUDA un noyau PAD en boucle, permettant à la bibliothèque de traiter des tenseurs de plus de 65 000 lignes ou tranches. Elle comprend également des binaires précompilés pour Apple Silicon, les Mac Intel, iOS et plusieurs versions d’Ubuntu (CPU, Vulkan et CUDA 12.8). Le code et les attestations sont accessibles depuis la page GitHub.

## Les faits

- Version b11510 publiée le 2026‑10‑08
- Le nouveau noyau PAD CUDA prend en charge plus de 65 535 lignes

## Pourquoi c'est important

Les développeurs peuvent désormais exécuter des modèles de langage plus volumineux sur des GPU NVIDIA sans se heurter à l’ancienne limite de lignes.

## Sources et références

1. [ggml-org/llama.cpp b11510](https://github.com/ggml-org/llama.cpp/releases/tag/b11510) – llama.cpp, 2026-10-08

Dernière mise à jour: 2026-10-08
