O projeto llama.cpp publicou uma nova versão de pré-lançamento, chamada b11517, em 9 de outubro de 2026. A atualização adiciona uma opção CUDA que permite definir a precisão da source-1 nos auxiliares MMQ, uma parte de baixo nível do código para GPU. A alteração, assinada por um colaborador da NVIDIA, aplica-se às compilações com CUDA 12 e 13 disponíveis para Linux e Windows. O lançamento também inclui compilações para várias outras plataformas, do macOS com Apple Silicon ao Android com Snapdragon.
A atualização está disponível na página do projeto no GitHub e no site llama.app.
Por que importa
Agora, desenvolvedores podem controlar a precisão da GPU no llama.cpp, o que pode melhorar o desempenho ou reduzir o uso de memória ao executar modelos LLaMA.