OossaAI ontwikkelt zich snel. Wij leggen het eenvoudig uit.

llama.cpp voegt 2-uitgelijnde F32-loads toe voor Intel Vulkan-builds

De update versnelt matrixvermenigvuldiging op Intel-GPU’s door telkens twee floats tegelijk te laden.

Kort berichtOossa1 min lezen

Het llama.cpp-project heeft een patch uitgebracht die verandert hoe Vulkan-code 32-bits floats (F32) laadt. Op Intel-GPU’s is twee floats tegelijk laden sneller dan ze één voor één te laden. Daarom gebruikt de nieuwe logica een 2-uitgelijnde load in de routine mul_mat_vec. De wijziging voegt ook een ontbrekende uitlijningscontrole toe. Benchmarks op een B60-testbord laten voor bepaalde matrixgroottes een snelheid tot 1,63 TFLOPS zien, een duidelijke verbetering ten opzichte van de vorige versie.

Waarom het ertoe doet

Snellere GPU-berekeningen zorgen voor snellere LLM-inferentie voor gebruikers die llama.cpp op Intel-hardware draaien.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.

Bronnen en referenties

#BronMediumDatumKernpunt
1ggml-org/llama.cpp b11266 ↗llama.cpp29 sep 2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 sep 2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 bronnen

Laatst bijgewerkt: ·Markdown·llms.txt