# llama.cpp b11510 unterstützt größere Tensoren mit CUDA

> Die Open-Source-Inferenzbibliothek für LLaMA erscheint in Version b11510 mit einem neuen CUDA-Kernel für mehr als 65.535 Zeilen sowie mit vorgefertigten Binärdateien für macOS, iOS und Linux.

Oossa · 2026-10-08 · https://oossa.com/de/llama-cpp-b11510-adds-cuda-support-for-larger-tensors

Das ggml-org-Team hat am 8. Oktober 2026 llama.cpp in Version b11510 veröffentlicht. Die Version enthält einen CUDA-Kernel mit Schleife für PAD, mit dem die Bibliothek Tensoren mit mehr als 65.000 Zeilen oder Slices verarbeiten kann. Außerdem sind vorgefertigte Binärdateien für Apple Silicon, Intel-Macs, iOS und mehrere Ubuntu-Varianten enthalten (CPU, Vulkan und CUDA 12.8). Der Code und die Attestierungen sind auf der GitHub-Seite verlinkt.

## Die Fakten

- Version b11510 wurde am 2026-10-08 veröffentlicht
- Neuer CUDA-PAD-Kernel unterstützt mehr als 65.535 Zeilen

## Warum es wichtig ist

Entwickler können nun größere Sprachmodelle auf NVIDIA-GPUs ausführen, ohne an die bisherige Zeilenbegrenzung zu stoßen.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11510](https://github.com/ggml-org/llama.cpp/releases/tag/b11510) – llama.cpp, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
