# llama.cpp v0.1.11534 minskar onödiga CUDA-kopior

> Biblioteket för LLaMA-inferens med öppen källkod minskar onödiga minnesöverföringar på GPU:n, vilket sänker overheaden för vissa arbetsbelastningar.

Oossa · 2026-10-09 · https://oossa.com/sv/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

ggml-org-teamet släppte llama.cpp version b11534 den 2026-10-09. Uppdateringen integrerar kopior av tillståndsögonblicksbilder i den rekurrenta cachen och tar bort extra CUDA-kopior när K = 1, ett fall med avkodning utan spekulativ avkodning. Ändringen gäller endast CUDA-backendmiljön, så versioner för CPU och Vulkan påverkas inte. Förkompilerade binärfiler för macOS, iOS och flera varianter av Ubuntu finns att ladda ner.

Användare av CUDA-versionen bör märka av något mindre minnestrafik på GPU:n, vilket kan ge högre hastighet på maskinvara som stöds.

## Fakta

- Version b11534 släpptes den 2026-10-09
- Borttagningen av CUDA-kopior gäller när K = 1 (utan spekulativ avkodning)

## Varför det spelar roll

CUDA-användare kan få snabbare inferens eftersom biblioteket nu flyttar mindre data på GPU:n.

## Källor och referenser

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Senast uppdaterad: 2026-10-09
