A ggml-org publicou a versão b11539 do llama.cpp, um runtime leve para LLMs que funciona em vários dispositivos. Há novos arquivos binários para macOS com Apple Silicon, macOS com processadores Intel, iOS XCFramework e várias compilações para Ubuntu, com suporte a CPU, Vulkan e CUDA 12.8. Os links para download estão na página da versão no GitHub.
Por que importa
Agora, desenvolvedores podem executar o llama.cpp localmente em mais tipos de hardware sem precisar compilá-lo por conta própria.