Het llama.cpp-project bracht op 2026‑10‑11 versie b11554 uit. De update bevat specifieke verbeteringen voor Vulkan: die detecteren dubbele rij-ID’s bij matrixvermenigvuldigingen en verwerken ze in een voorbewerking, in plaats van ze steeds opnieuw af te handelen. Ook is de optimalisatie ‘hoist row ids’ verbeterd, zodat die altijd wordt uitgevoerd en meerdere compacte tegels kan opleveren. Daardoor hoeft de GPU minder werkgroepen te starten en kan die waar mogelijk eerder stoppen.
Waarom het ertoe doet
Gebruikers van llama.cpp op een GPU kunnen sneller inferentie uitvoeren doordat de bibliotheek dezelfde berekeningen niet meer herhaalt.