Oossa

llama.cpp optimerar Vulkan för upprepade rader

Det öppna LLaMA-biblioteket för inferens hoppar nu över onödigt arbete när rader upprepas på GPU:n, vilket ökar hastigheten på Vulkan-enheter.

NotisAv Publicerad av Oossa: 1 min läsning

Projektet llama.cpp släppte version b11554 den 2026‑10‑11. Uppdateringen innehåller Vulkan-specifika förbättringar som upptäcker dubblerade rad-ID:n i matrismultiplikationer och hanterar dem i ett förberedande steg i stället för i en loop. Den förbättrar också optimeringen ”hoist row ids”, så att den alltid körs och kan skapa flera kompakta brickor. Ändringarna gör att GPU:n kan starta färre arbetsgrupper och avsluta tidigt när det är möjligt.

Varför det spelar roll

Användare som kör llama.cpp på GPU kan få snabbare inferens eftersom biblioteket nu undviker att upprepa samma beräkningar.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.