La biblioteca ggml‑org/llama.cpp publicó la versión b11475 el 7 de octubre de 2026. Esta corrige un fallo en el backend Metal (GPU de Apple): una operación fusionada MUL_MAT+ADD elegía la matriz residual equivocada, lo que producía resultados incorrectos en modelos que realizan varias multiplicaciones de matrices en un mismo paso. La corrección hace que el codificador seleccione el operando correcto y restablece la precisión de los resultados en las GPU Metal.
Por qué importa
Los desarrolladores que usan llama.cpp en GPU de Apple obtendrán resultados fiables de los modelos, en lugar de las probabilidades uniformes que se producían antes.