O projeto ggml‑org/llama.cpp lançou a versão b11530 em 2026-10-09. A mudança mantém estático o grafo de amostragem do backend entre ubatches, impedindo que sua estrutura se altere durante as etapas de reserva e decodificação. Isso corrige falhas que ocorriam quando a topologia do grafo mudava após uma compilação de reserva. A correção se aplica a todas as compilações listadas — macOS, Linux, Android, Windows e openEuler — e a todos os backends de hardware, como CUDA, Vulkan e OpenCL.
Por que importa
Desenvolvedores que usam o llama.cpp terão menos erros em tempo de execução ao gerar várias saídas em qualquer CPU ou GPU compatível.