Das llama.cpp-Projekt hat am 2026‑10‑11 Version b11554 veröffentlicht. Das Update enthält Vulkan-spezifische Anpassungen: Bei Matrixmultiplikationen werden doppelte Zeilen-IDs erkannt und in einem Vorlauf verarbeitet, statt sie in einer Schleife abzuarbeiten. Außerdem wurde die Optimierung „hoist row ids“ verbessert: Sie wird nun immer ausgeführt und kann mehrere kompakte Kacheln ausgeben. Dadurch muss die GPU weniger Arbeitsgruppen starten und kann gegebenenfalls früher abbrechen.
Warum es wichtig ist
Nutzer von llama.cpp auf der GPU können von einer schnelleren Inferenz profitieren, weil die Bibliothek gleiche Berechnungen nicht mehr wiederholt.