ggml-org släppte llama.cpp version b11462 den 2026-10-07. Uppdateringen städar upp SYCL-baserade attention-buffertar, en lågnivålösning för grafikberäkningar. Den innehåller också förbyggda binärer för macOS (Apple Silicon och Intel), iOS och flera Ubuntu-varianter, med versioner för CPU, Vulkan och CUDA 12.8. Binärerna kan laddas ner från GitHub-sidan för utgåvan.
Varför det spelar roll
Utvecklare kan nu köra llama.cpp lokalt på fler plattformar utan att bygga från källkod, vilket gör det snabbare att experimentera.