Oossa

llama.cpp b11510 prend en charge les grands tenseurs sur CUDA

La bibliothèque open source d’inférence LLaMA passe à la version b11510. Elle intègre un nouveau noyau CUDA capable de traiter plus de 65 535 lignes, ainsi que des binaires pour macOS, iOS et Linux.

BrèvePar Publié par Oossa: 1 min de lecture

L’équipe ggml‑org a publié llama.cpp version b11510 le 8 oct. 2026. Cette version ajoute à CUDA un noyau PAD en boucle, permettant à la bibliothèque de traiter des tenseurs de plus de 65 000 lignes ou tranches. Elle comprend également des binaires précompilés pour Apple Silicon, les Mac Intel, iOS et plusieurs versions d’Ubuntu (CPU, Vulkan et CUDA 12.8). Le code et les attestations sont accessibles depuis la page GitHub.

Pourquoi c'est important

Les développeurs peuvent désormais exécuter des modèles de langage plus volumineux sur des GPU NVIDIA sans se heurter à l’ancienne limite de lignes.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.