ggml‑org ha pubblicato llama.cpp versione b11462 il 2026‑10‑07. L’aggiornamento ripulisce i buffer di attention basati su SYCL, un’interfaccia di basso livello per il calcolo grafico. Include inoltre binari precompilati per macOS (Apple Silicon e Intel), iOS e diverse versioni di Ubuntu, con build per CPU, Vulkan e CUDA 12.8. I binari si possono scaricare dalla pagina della release su GitHub.
Perché conta
Gli sviluppatori possono ora eseguire llama.cpp in locale su più piattaforme senza compilarlo dal codice sorgente, velocizzando la sperimentazione.