Oossa

llama.cpp v0.1.11534 minskar onödiga CUDA-kopior

Biblioteket för LLaMA-inferens med öppen källkod minskar onödiga minnesöverföringar på GPU:n, vilket sänker overheaden för vissa arbetsbelastningar.

NotisAv Publicerad av Oossa: 1 min läsning

ggml-org-teamet släppte llama.cpp version b11534 den 2026-10-09. Uppdateringen integrerar kopior av tillståndsögonblicksbilder i den rekurrenta cachen och tar bort extra CUDA-kopior när K = 1, ett fall med avkodning utan spekulativ avkodning. Ändringen gäller endast CUDA-backendmiljön, så versioner för CPU och Vulkan påverkas inte. Förkompilerade binärfiler för macOS, iOS och flera varianter av Ubuntu finns att ladda ner.

Användare av CUDA-versionen bör märka av något mindre minnestrafik på GPU:n, vilket kan ge högre hastighet på maskinvara som stöds.

Varför det spelar roll

CUDA-användare kan få snabbare inferens eftersom biblioteket nu flyttar mindre data på GPU:n.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.