# llama.cpp optimerar Vulkan för upprepade rader

> Det öppna LLaMA-biblioteket för inferens hoppar nu över onödigt arbete när rader upprepas på GPU:n, vilket ökar hastigheten på Vulkan-enheter.

Oossa · 2026-10-11 · https://oossa.com/sv/llama-cpp-adds-vulkan-duplicate-row-optimizations

Projektet llama.cpp släppte version b11554 den 2026‑10‑11. Uppdateringen innehåller Vulkan-specifika förbättringar som upptäcker dubblerade rad-ID:n i matrismultiplikationer och hanterar dem i ett förberedande steg i stället för i en loop. Den förbättrar också optimeringen ”hoist row ids”, så att den alltid körs och kan skapa flera kompakta brickor. Ändringarna gör att GPU:n kan starta färre arbetsgrupper och avsluta tidigt när det är möjligt.

## Fakta

- Version b11554 släpptes söndag 11 oktober 2026
- Hantering av upprepade rader för Vulkan har lagts till i llama.cpp

## Varför det spelar roll

Användare som kör llama.cpp på GPU kan få snabbare inferens eftersom biblioteket nu undviker att upprepa samma beräkningar.

## Källor och referenser

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

Senast uppdaterad: 2026-10-11
