Oossa

llama.cpp b11510 unterstützt größere Tensoren mit CUDA

Die Open-Source-Inferenzbibliothek für LLaMA erscheint in Version b11510 mit einem neuen CUDA-Kernel für mehr als 65.535 Zeilen sowie mit vorgefertigten Binärdateien für macOS, iOS und Linux.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das ggml-org-Team hat am 8. Oktober 2026 llama.cpp in Version b11510 veröffentlicht. Die Version enthält einen CUDA-Kernel mit Schleife für PAD, mit dem die Bibliothek Tensoren mit mehr als 65.000 Zeilen oder Slices verarbeiten kann. Außerdem sind vorgefertigte Binärdateien für Apple Silicon, Intel-Macs, iOS und mehrere Ubuntu-Varianten enthalten (CPU, Vulkan und CUDA 12.8). Der Code und die Attestierungen sind auf der GitHub-Seite verlinkt.

Warum es wichtig ist

Entwickler können nun größere Sprachmodelle auf NVIDIA-GPUs ausführen, ohne an die bisherige Zeilenbegrenzung zu stoßen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.