Het ggml-org-team heeft llama.cpp-release b11531 gepubliceerd. De chat-API is herzien en er zijn vooraf gebouwde binaries beschikbaar voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-varianten, waaronder versies voor CPU, Vulkan en CUDA 12.8. De downloadlinks staan op de GitHub-releasepagina. Gebruikers kunnen nu op meer platforms lokaal LLM’s draaien zonder zelf te hoeven compileren.
Waarom het ertoe doet
Ontwikkelaars kunnen vandaag op meer apparaten lokaal Llama-modellen draaien, zonder eerst te hoeven bouwen, en Ubuntu ondersteunt GPU-versnelling.