# llama.cpp v0.1.11534 optimaliseert CUDA-kopieën

> De open-sourcelibrary voor LLaMA-inferentie voorkomt onnodige geheugenverplaatsingen op de GPU en verlaagt zo de overhead bij bepaalde workloads.

Oossa · 2026-10-09 · https://oossa.com/nl/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

Het ggml‑org-team heeft op 2026-10-09 versie b11534 van llama.cpp uitgebracht. De update voegt kopieën van statusmomentopnamen samen met de recurrent cache en schrapt extra CUDA-kopieën wanneer K = 1, een geval zonder speculatieve decoding. De wijziging geldt alleen voor de CUDA-backend; CPU- en Vulkan-builds blijven ongewijzigd. Vooraf gebouwde binaries voor macOS, iOS en verschillende Ubuntu-varianten zijn te downloaden.

Gebruikers van de CUDA-versie zouden iets minder GPU-geheugenverkeer moeten zien, wat de snelheid op ondersteunde hardware kan verbeteren.

## De feiten

- Versie b11534 is uitgebracht op 2026-10-09
- CUDA-kopieën worden verwijderd wanneer K = 1 (zonder speculatieve decoding)

## Waarom het ertoe doet

CUDA-gebruikers kunnen profiteren van snellere inferentie doordat de bibliotheek minder data op de GPU verplaatst.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Laatst bijgewerkt: 2026-10-09
