Oossa

llama.cpp versnelt Vulkan met optimalisaties voor dubbele rijen

De opensourcelibrary voor LLaMA-inferentie slaat nu overbodig werk over wanneer rijen op de GPU dubbel voorkomen. Dat levert snelheidswinst op Vulkan-apparaten op.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Het llama.cpp-project bracht op 2026‑10‑11 versie b11554 uit. De update bevat specifieke verbeteringen voor Vulkan: die detecteren dubbele rij-ID’s bij matrixvermenigvuldigingen en verwerken ze in een voorbewerking, in plaats van ze steeds opnieuw af te handelen. Ook is de optimalisatie ‘hoist row ids’ verbeterd, zodat die altijd wordt uitgevoerd en meerdere compacte tegels kan opleveren. Daardoor hoeft de GPU minder werkgroepen te starten en kan die waar mogelijk eerder stoppen.

Waarom het ertoe doet

Gebruikers van llama.cpp op een GPU kunnen sneller inferentie uitvoeren doordat de bibliotheek dezelfde berekeningen niet meer herhaalt.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.