ggml‑org a publié la version b11462 de llama.cpp le 2026‑10‑07. Cette mise à jour nettoie les tampons d’attention reposant sur SYCL, une interface de calcul graphique de bas niveau. Elle comprend aussi des binaires précompilés pour macOS (Apple Silicon et Intel), iOS et plusieurs variantes d’Ubuntu, avec des versions pour CPU, Vulkan et CUDA 12.8. Les binaires sont téléchargeables depuis la page de la version sur GitHub.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter llama.cpp localement sur davantage de plateformes sans le compiler à partir des sources, ce qui accélère leurs expérimentations.