A biblioteca ggml‑org/llama.cpp lançou a versão b11475 em 7 de outubro de 2026. Ela corrige um bug no backend Metal (GPU da Apple): em uma operação fundida MUL_MAT+ADD, era escolhida a matriz residual errada, o que gerava resultados incorretos em modelos que usam várias multiplicações de matrizes em uma única etapa. Com a correção, o encoder seleciona o operando correto e restaura a precisão dos resultados em GPUs Metal.
Por que importa
Desenvolvedores que usam llama.cpp em GPUs da Apple passam a obter resultados confiáveis dos modelos, em vez das probabilidades uniformes geradas antes.