# llama.cpp b11494 optimaliseert CUDA-warps

> De opensourcelibrary llama.cpp gebruikt nu vier GDN-statekolommen per CUDA-warp, wat de GPU-prestaties verbetert.

Oossa · 2026-10-08 · https://oossa.com/nl/llama-cpp-release-b11494-adds-cuda-warp-optimizations

Het team van ggml-org heeft versie b11494 van llama.cpp uitgebracht. De update past de CUDA-backend aan: die wijst voortaan vier GDN-statekolommen toe aan elke warp, in plaats van twee. Dit is nu de standaardinstelling. Er zijn binaries beschikbaar om te downloaden voor macOS (Apple Silicon en Intel), iOS en diverse Ubuntu-builds.

## De feiten

- Releasetag b11494 gepubliceerd op 2026-10-08
- De standaardwaarde voor CUDA cols_per_warp is ingesteld op 4

## Waarom het ertoe doet

Ontwikkelaars die llama.cpp op NVIDIA-GPU's gebruiken, kunnen rekenen op snellere inferentie zonder hun code aan te passen.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11494](https://github.com/ggml-org/llama.cpp/releases/tag/b11494) – llama.cpp, 2026-10-08

Laatst bijgewerkt: 2026-10-08
