Het llama.cpp-project heeft een patch uitgebracht die verandert hoe Vulkan-code 32-bits floats (F32) laadt. Op Intel-GPU’s is twee floats tegelijk laden sneller dan ze één voor één te laden. Daarom gebruikt de nieuwe logica een 2-uitgelijnde load in de routine mul_mat_vec. De wijziging voegt ook een ontbrekende uitlijningscontrole toe. Benchmarks op een B60-testbord laten voor bepaalde matrixgroottes een snelheid tot 1,63 TFLOPS zien, een duidelijke verbetering ten opzichte van de vorige versie.
Waarom het ertoe doet
Snellere GPU-berekeningen zorgen voor snellere LLM-inferentie voor gebruikers die llama.cpp op Intel-hardware draaien.