# llama.cpp optimiert Vulkan-Berechnungen mit doppelten Zeilen

> Die Open-Source-Bibliothek für LLaMA-Inferenz vermeidet auf Vulkan-Geräten nun redundante Arbeit, wenn sich Zeilen auf der GPU wiederholen – und wird dadurch schneller.

Oossa · 2026-10-11 · https://oossa.com/de/llama-cpp-adds-vulkan-duplicate-row-optimizations

Das llama.cpp-Projekt hat am 2026‑10‑11 Version b11554 veröffentlicht. Das Update enthält Vulkan-spezifische Anpassungen: Bei Matrixmultiplikationen werden doppelte Zeilen-IDs erkannt und in einem Vorlauf verarbeitet, statt sie in einer Schleife abzuarbeiten. Außerdem wurde die Optimierung „hoist row ids“ verbessert: Sie wird nun immer ausgeführt und kann mehrere kompakte Kacheln ausgeben. Dadurch muss die GPU weniger Arbeitsgruppen starten und kann gegebenenfalls früher abbrechen.

## Die Fakten

- Version b11554 wurde am So., 11. Okt. 2026, veröffentlicht
- llama.cpp unterstützt jetzt die Verarbeitung doppelter Zeilen unter Vulkan

## Warum es wichtig ist

Nutzer von llama.cpp auf der GPU können von einer schnelleren Inferenz profitieren, weil die Bibliothek gleiche Berechnungen nicht mehr wiederholt.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

Zuletzt aktualisiert: 2026-10-11
