Oossa

llama.cpp optimiert Vulkan-Berechnungen mit doppelten Zeilen

Die Open-Source-Bibliothek für LLaMA-Inferenz vermeidet auf Vulkan-Geräten nun redundante Arbeit, wenn sich Zeilen auf der GPU wiederholen – und wird dadurch schneller.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das llama.cpp-Projekt hat am 2026‑10‑11 Version b11554 veröffentlicht. Das Update enthält Vulkan-spezifische Anpassungen: Bei Matrixmultiplikationen werden doppelte Zeilen-IDs erkannt und in einem Vorlauf verarbeitet, statt sie in einer Schleife abzuarbeiten. Außerdem wurde die Optimierung „hoist row ids“ verbessert: Sie wird nun immer ausgeführt und kann mehrere kompakte Kacheln ausgeben. Dadurch muss die GPU weniger Arbeitsgruppen starten und kann gegebenenfalls früher abbrechen.

Warum es wichtig ist

Nutzer von llama.cpp auf der GPU können von einer schnelleren Inferenz profitieren, weil die Bibliothek gleiche Berechnungen nicht mehr wiederholt.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.