A ggml-org lançou o llama.cpp versão b11462 em 2026-10-07. A atualização reorganiza os buffers de atenção baseados em SYCL, uma interface de baixo nível para computação gráfica. Também inclui binários pré-compilados para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu, com builds para CPU, Vulkan e CUDA 12.8. Os binários estão disponíveis para download na página da versão no GitHub.
Por que importa
Agora, desenvolvedores podem executar o llama.cpp localmente em mais plataformas sem precisar compilar o código-fonte, o que agiliza os testes.