Biblioteket ggml‑org/llama.cpp släppte version b11475 den 7 oktober 2026. Den åtgärdar ett fel i Metal-motorn (för Apples GPU:er), där en sammanslagen MUL_MAT+ADD-operation valde fel restmatris. Det ledde till felaktiga resultat i modeller som utför flera matrismultiplikationer i ett steg. Åtgärden gör att kodaren väljer rätt operand, vilket ger korrekta resultat på Metal-GPU:er.
Varför det spelar roll
Utvecklare som använder llama.cpp på Apples GPU:er får nu tillförlitliga modellresultat i stället för de tidigare enhetliga sannolikheterna.