A equipe ggml-org publicou a versão b11531 do llama.cpp. A atualização reformula a API de chat e inclui binários pré-compilados para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu, com suporte a CPU, Vulkan e CUDA 12.8. Os links para download estão na página do lançamento no GitHub. Agora, usuários podem executar LLMs localmente em mais plataformas sem precisar compilar o software.
Por que importa
Desenvolvedores podem executar modelos Llama localmente em mais dispositivos sem precisar compilar o software, com suporte à aceleração por GPU no Ubuntu.