OossaKI entwickelt sich schnell. Wir erklären es einfach.

llama.cpp ergänzt 2-fach ausgerichtete F32-Ladevorgänge für Intel Vulkan

Das Update beschleunigt die Matrixmultiplikation auf Intel-GPUs, indem jeweils zwei Floats auf einmal geladen werden.

KurzmeldungOossa1 Min. Lesezeit

Das llama.cpp-Projekt hat einen Patch veröffentlicht, der ändert, wie der Vulkan-Code 32-Bit-Gleitkommazahlen (F32) lädt. Auf Intel-GPUs ist es schneller, zwei Floats gleichzeitig statt einzeln zu laden. Deshalb nutzt die neue Logik in der Routine mul_mat_vec einen 2-fach ausgerichteten Ladevorgang. Außerdem kommt eine zuvor fehlende Ausrichtungsprüfung hinzu. Benchmarks auf einem B60-Testboard zeigen bei bestimmten Matrixgrößen bis zu 1,63 TFLOPS – eine spürbare Steigerung gegenüber der vorherigen Version.

Warum es wichtig ist

Schnellere GPU-Berechnungen ermöglichen Nutzern, die llama.cpp auf Intel-Hardware einsetzen, eine zügigere LLM-Inferenz.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.

Quellen und Referenzen

#QuelleMediumDatumKernaussage
1ggml-org/llama.cpp b11266 ↗llama.cpp29.09.2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30.09.2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 Quellen

Zuletzt aktualisiert: ·Markdown·llms.txt