Il team ggml-org ha pubblicato llama.cpp versione b11270 il 30 settembre 2026. L’aggiornamento modifica un’operazione GPU usata dalla piattaforma HIP di AMD, sostituendo un’istruzione di sottrazione di byte più lenta con una più rapida. La release include anche nuovi pacchetti binari per macOS (Apple Silicon e Intel), iOS e diverse build di Ubuntu, comprese quelle con supporto GPU Vulkan.
Perché conta
La modifica può velocizzare l’inferenza sui dispositivi AMD, mentre i binari pronti all’uso rendono più semplice per gli sviluppatori provare llama.cpp su un maggior numero di piattaforme.