Oossa

llama.cpp v0.1.11534 optimiert CUDA-Kopien

Die Open-Source-Bibliothek für LLaMA-Inferenz vermeidet redundante GPU-Speichertransfers und senkt so den Aufwand bei bestimmten Workloads.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das Team von ggml-org hat am 2026-10-09 llama.cpp Version b11534 veröffentlicht. Das Update integriert Kopien von Zustands-Snapshots in den rekurrenten Cache und vermeidet zusätzliche CUDA-Kopien, wenn K = 1 gilt – also bei einem Decoding ohne spekulative Verfahren. Die Änderung betrifft nur das CUDA-Backend; CPU- und Vulkan-Builds bleiben unverändert. Vorgefertigte Binärdateien für macOS, iOS und mehrere Ubuntu-Varianten stehen zum Download bereit.

Wer die CUDA-Version nutzt, dürfte etwas weniger GPU-Speicherverkehr feststellen. Auf unterstützter Hardware kann das die Geschwindigkeit verbessern.

Warum es wichtig ist

CUDA-Nutzer können von einer schnelleren Inferenz profitieren, weil die Bibliothek nun weniger Daten auf der GPU verschiebt.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.