OossaAI utvecklas fort. Vi förklarar det enkelt.

llama.cpp lägger till 2-justerade F32-inläsningar för Intel Vulkan

Uppdateringen snabbar upp matrismultiplikation på Intel-GPU:er genom att läsa in två flyttal åt gången.

NotisOossa1 min läsning

Projektet llama.cpp har släppt en patch som ändrar hur Vulkan-koden läser in 32-bitars flyttal (F32). På Intel-GPU:er går det snabbare att läsa in två flyttal samtidigt än ett i taget, så den nya logiken använder en 2-justerad inläsning i rutinen mul_mat_vec. Ändringen lägger också till en tidigare saknad justeringskontroll. Riktmärketester på ett B60-testkort visar upp till 1,63 TFLOPS för vissa matrisstorlekar, en märkbar förbättring jämfört med den tidigare versionen.

Varför det spelar roll

Snabbare GPU-beräkningar innebär snabbare LLM-inferens för användare som kör llama.cpp på Intel-hårdvara.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.

Källor och referenser

#KällaUtgivareDatumKärnpunkt
1ggml-org/llama.cpp b11266 ↗llama.cpp29 sep. 2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 sep. 2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 källor

Senast uppdaterad: ·Markdown·llms.txt