# llama.cpp voegt 2-uitgelijnde F32-loads toe voor Intel Vulkan-builds

> De update versnelt matrixvermenigvuldiging op Intel-GPU’s door telkens twee floats tegelijk te laden.

Oossa · 2026-09-30 · https://oossa.com/nl/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

Het llama.cpp-project heeft een patch uitgebracht die verandert hoe Vulkan-code 32-bits floats (F32) laadt. Op Intel-GPU’s is twee floats tegelijk laden sneller dan ze één voor één te laden. Daarom gebruikt de nieuwe logica een 2-uitgelijnde load in de routine mul_mat_vec. De wijziging voegt ook een ontbrekende uitlijningscontrole toe. Benchmarks op een B60-testbord laten voor bepaalde matrixgroottes een snelheid tot 1,63 TFLOPS zien, een duidelijke verbetering ten opzichte van de vorige versie.

## De feiten

- Patch uitgebracht op 30 september 2026 (b11266)
- Snelheidswinst tot 1,63 TFLOPS bij een matrix van 4096×8×14336

## Waarom het ertoe doet

Snellere GPU-berekeningen zorgen voor snellere LLM-inferentie voor gebruikers die llama.cpp op Intel-hardware draaien.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Laatst bijgewerkt: 2026-09-30
