Projektet llama.cpp släppte version b11554 den 2026‑10‑11. Uppdateringen innehåller Vulkan-specifika förbättringar som upptäcker dubblerade rad-ID:n i matrismultiplikationer och hanterar dem i ett förberedande steg i stället för i en loop. Den förbättrar också optimeringen ”hoist row ids”, så att den alltid körs och kan skapa flera kompakta brickor. Ändringarna gör att GPU:n kan starta färre arbetsgrupper och avsluta tidigt när det är möjligt.
Varför det spelar roll
Användare som kör llama.cpp på GPU kan få snabbare inferens eftersom biblioteket nu undviker att upprepa samma beräkningar.