Open source-projektet llama.cpp släppte version b11558 den 11 okt. 2026. Uppdateringen åtgärdar ett fel som gjorde att OpenCL-kärnor överskred enhetsgränserna för bilder när Q4_K-kvantisering användes. Den lägger också till en reservlösning för enheter som stöter på dessa gränser och rättar beräkningar för broadcasting och RMS-norm i Q4_0-kärnor. Ändringarna har tagits fram tillsammans med Hongqiang Wang från Qualcomm.
Varför det spelar roll
Utvecklare som använder llama.cpp på grafikprocessorer kan nu köra kvantiserade Q4_K-modeller på fler typer av hårdvara utan krascher.