ggml-org a publié la version b11539 de llama.cpp, un moteur léger pour exécuter des LLM sur de nombreux appareils. De nouvelles archives binaires sont disponibles pour macOS sur Apple Silicon, macOS sur Mac Intel, iOS XCFramework et plusieurs configurations Ubuntu couvrant les processeurs, Vulkan et CUDA 12.8. Les liens de téléchargement sont disponibles sur la page de la version sur GitHub.
Pourquoi c'est important
Les développeurs peuvent désormais exécuter llama.cpp localement sur davantage de matériels sans avoir à le compiler eux-mêmes.