De ggml‑org/llama.cpp-bibliotheek bracht op 7 oktober 2026 versie b11475 uit. Die verhelpt een fout in de Metal-backend (voor Apple GPU’s), waarbij een gefuseerde MUL_MAT+ADD-bewerking de verkeerde residuele matrix selecteerde. Daardoor kregen modellen die in één stap meerdere matrixvermenigvuldigingen uitvoeren onjuiste resultaten. De encoder kiest nu de juiste operand, waardoor Metal GPU’s weer nauwkeurige uitvoer leveren.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp op Apple GPU’s gebruiken, krijgen nu betrouwbare modeluitvoer in plaats van de voorheen uniforme kansen.