A equipe ggml-org publicou o lançamento b11515 do llama.cpp em 2026-10-09. A atualização adiciona uma multiplicação de matriz por vetor quantizada (MMVQ) com layout reorganizado Q5_K baseado em SYCL e um operador GLU fundido, melhorando o desempenho em hardware compatível. O lançamento também inclui binários prontos para Apple Silicon, Macs Intel, iOS, Ubuntu (CPU, Vulkan, CUDA 12.8) e IBM s390x. Os usuários podem baixar o arquivo adequado na página do GitHub.
Por que importa
Desenvolvedores agora podem executar o llama.cpp mais rapidamente em GPUs compatíveis com SYCL, sem precisar compilá-lo a partir do código-fonte.