Das Open-Source-Projekt llama.cpp hat am 11. Oktober 2026 Version b11558 veröffentlicht. Das Update behebt einen Fehler, durch den OpenCL-Kernels bei quantisierten Q4_K-Gewichten die Image-Limits des Geräts überschreiten konnten. Außerdem gibt es nun einen Ausweichpfad für Geräte, bei denen diese Limits erreicht werden. Darüber hinaus korrigiert das Update Broadcasting- und RMS-Norm-Berechnungen für Q4_0-Kernels. An den Änderungen war auch Hongqiang Wang von Qualcomm als Mitautor beteiligt.
Warum es wichtig ist
Entwickler, die llama.cpp auf GPUs einsetzen, können quantisierte Q4_K-Modelle jetzt auf mehr Hardware ohne Abstürze ausführen.