Projektet llama.cpp har släppt en patch som ändrar hur Vulkan-koden läser in 32-bitars flyttal (F32). På Intel-GPU:er går det snabbare att läsa in två flyttal samtidigt än ett i taget, så den nya logiken använder en 2-justerad inläsning i rutinen mul_mat_vec. Ändringen lägger också till en tidigare saknad justeringskontroll. Riktmärketester på ett B60-testkort visar upp till 1,63 TFLOPS för vissa matrisstorlekar, en märkbar förbättring jämfört med den tidigare versionen.
Varför det spelar roll
Snabbare GPU-beräkningar innebär snabbare LLM-inferens för användare som kör llama.cpp på Intel-hårdvara.