Die Bibliothek ggml‑org/llama.cpp hat am 7. Oktober 2026 Version b11475 veröffentlicht. Sie behebt einen Fehler im Metal-Backend (Apple-GPU), bei dem eine zusammengefasste MUL_MAT+ADD-Operation die falsche Residualmatrix auswählte. Dadurch kam es bei Modellen, die in einem Schritt mehrere Matrixmultiplikationen ausführen, zu falschen Ergebnissen. Mit der Korrektur wählt der Encoder den richtigen Operanden aus, sodass Metal-GPUs wieder korrekte Ausgaben liefern.
Warum es wichtig ist
Entwickler, die llama.cpp auf Apple-GPUs einsetzen, erhalten nun zuverlässige Modellausgaben statt der zuvor einheitlichen Wahrscheinlichkeiten.