# llama.cpp lägger till 2-justerade F32-inläsningar för Intel Vulkan

> Uppdateringen snabbar upp matrismultiplikation på Intel-GPU:er genom att läsa in två flyttal åt gången.

Oossa · 2026-09-30 · https://oossa.com/sv/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

Projektet llama.cpp har släppt en patch som ändrar hur Vulkan-koden läser in 32-bitars flyttal (F32). På Intel-GPU:er går det snabbare att läsa in två flyttal samtidigt än ett i taget, så den nya logiken använder en 2-justerad inläsning i rutinen mul_mat_vec. Ändringen lägger också till en tidigare saknad justeringskontroll. Riktmärketester på ett B60-testkort visar upp till 1,63 TFLOPS för vissa matrisstorlekar, en märkbar förbättring jämfört med den tidigare versionen.

## Fakta

- Patch släpptes 30 september 2026 (b11266)
- Upp till 1,63 TFLOPS snabbare för en matris på 4096×8×14336

## Varför det spelar roll

Snabbare GPU-beräkningar innebär snabbare LLM-inferens för användare som kör llama.cpp på Intel-hårdvara.

## Källor och referenser

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Senast uppdaterad: 2026-09-30
