# llama.cpp versnelt Vulkan met optimalisaties voor dubbele rijen

> De opensourcelibrary voor LLaMA-inferentie slaat nu overbodig werk over wanneer rijen op de GPU dubbel voorkomen. Dat levert snelheidswinst op Vulkan-apparaten op.

Oossa · 2026-10-11 · https://oossa.com/nl/llama-cpp-adds-vulkan-duplicate-row-optimizations

Het llama.cpp-project bracht op 2026‑10‑11 versie b11554 uit. De update bevat specifieke verbeteringen voor Vulkan: die detecteren dubbele rij-ID’s bij matrixvermenigvuldigingen en verwerken ze in een voorbewerking, in plaats van ze steeds opnieuw af te handelen. Ook is de optimalisatie ‘hoist row ids’ verbeterd, zodat die altijd wordt uitgevoerd en meerdere compacte tegels kan opleveren. Daardoor hoeft de GPU minder werkgroepen te starten en kan die waar mogelijk eerder stoppen.

## De feiten

- Versie b11554 uitgebracht op zo 11 okt 2026
- llama.cpp kan op Vulkan dubbele rijen verwerken

## Waarom het ertoe doet

Gebruikers van llama.cpp op een GPU kunnen sneller inferentie uitvoeren doordat de bibliotheek dezelfde berekeningen niet meer herhaalt.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

Laatst bijgewerkt: 2026-10-11
