# llama.cpp v0.1.11534 optimiert CUDA-Kopien

> Die Open-Source-Bibliothek für LLaMA-Inferenz vermeidet redundante GPU-Speichertransfers und senkt so den Aufwand bei bestimmten Workloads.

Oossa · 2026-10-09 · https://oossa.com/de/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

Das Team von ggml-org hat am 2026-10-09 llama.cpp Version b11534 veröffentlicht. Das Update integriert Kopien von Zustands-Snapshots in den rekurrenten Cache und vermeidet zusätzliche CUDA-Kopien, wenn K = 1 gilt – also bei einem Decoding ohne spekulative Verfahren. Die Änderung betrifft nur das CUDA-Backend; CPU- und Vulkan-Builds bleiben unverändert. Vorgefertigte Binärdateien für macOS, iOS und mehrere Ubuntu-Varianten stehen zum Download bereit.

Wer die CUDA-Version nutzt, dürfte etwas weniger GPU-Speicherverkehr feststellen. Auf unterstützter Hardware kann das die Geschwindigkeit verbessern.

## Die Fakten

- Version b11534 wurde am 2026-10-09 veröffentlicht
- Die CUDA-Kopien werden im Fall K = 1 (ohne spekulatives Decoding) vermieden

## Warum es wichtig ist

CUDA-Nutzer können von einer schnelleren Inferenz profitieren, weil die Bibliothek nun weniger Daten auf der GPU verschiebt.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
