Oossa

llama.cpp v0.1.11534 optimaliseert CUDA-kopieën

De open-sourcelibrary voor LLaMA-inferentie voorkomt onnodige geheugenverplaatsingen op de GPU en verlaagt zo de overhead bij bepaalde workloads.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het ggml‑org-team heeft op 2026-10-09 versie b11534 van llama.cpp uitgebracht. De update voegt kopieën van statusmomentopnamen samen met de recurrent cache en schrapt extra CUDA-kopieën wanneer K = 1, een geval zonder speculatieve decoding. De wijziging geldt alleen voor de CUDA-backend; CPU- en Vulkan-builds blijven ongewijzigd. Vooraf gebouwde binaries voor macOS, iOS en verschillende Ubuntu-varianten zijn te downloaden.

Gebruikers van de CUDA-versie zouden iets minder GPU-geheugenverkeer moeten zien, wat de snelheid op ondersteunde hardware kan verbeteren.

Waarom het ertoe doet

CUDA-gebruikers kunnen profiteren van snellere inferentie doordat de bibliotheek minder data op de GPU verplaatst.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.