Het llama.cpp-project publiceerde op 9 Oct 2026 een nieuwe pre-release met de naam b11517. De update voegt een CUDA-optie toe waarmee gebruikers de precisie van source-1 kunnen doorgeven aan de MMQ-helpers, een onderdeel van de GPU-code op laag niveau. De wijziging is ondertekend door een NVIDIA-bijdrager en geldt voor de CUDA 12- en 13-builds voor Linux en Windows. De release bevat ook builddoelen voor veel andere platforms, van macOS op Apple Silicon tot Android op Snapdragon.
De update is beschikbaar via de GitHub-pagina van het project en de website llama.app.
Waarom het ertoe doet
Ontwikkelaars kunnen nu de GPU-precisie in llama.cpp instellen. Dat kan de prestaties of het geheugengebruik verbeteren bij het uitvoeren van LLaMA-modellen.