# llama.cpp ergänzt 2-fach ausgerichtete F32-Ladevorgänge für Intel Vulkan

> Das Update beschleunigt die Matrixmultiplikation auf Intel-GPUs, indem jeweils zwei Floats auf einmal geladen werden.

Oossa · 2026-09-30 · https://oossa.com/de/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

Das llama.cpp-Projekt hat einen Patch veröffentlicht, der ändert, wie der Vulkan-Code 32-Bit-Gleitkommazahlen (F32) lädt. Auf Intel-GPUs ist es schneller, zwei Floats gleichzeitig statt einzeln zu laden. Deshalb nutzt die neue Logik in der Routine mul_mat_vec einen 2-fach ausgerichteten Ladevorgang. Außerdem kommt eine zuvor fehlende Ausrichtungsprüfung hinzu. Benchmarks auf einem B60-Testboard zeigen bei bestimmten Matrixgrößen bis zu 1,63 TFLOPS – eine spürbare Steigerung gegenüber der vorherigen Version.

## Die Fakten

- Patch veröffentlicht am 30. Sep. 2026 (b11266)
- Bis zu 1,63 TFLOPS bei einer 4096×8×14336-Matrix

## Warum es wichtig ist

Schnellere GPU-Berechnungen ermöglichen Nutzern, die llama.cpp auf Intel-Hardware einsetzen, eine zügigere LLM-Inferenz.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Zuletzt aktualisiert: 2026-09-30
