Teamet ggml‑org släppte version b11262 av llama.cpp den 29 september 2026. Uppdateringen lägger till stöd för AVX512‑FP16, som beräknar skalärprodukter med halv precision (f16) men summerar resultaten med enkel precision (f32) för bättre noggrannhet. Det är en förändring på låg nivå som snabbar upp inferens på processorer med instruktionsuppsättningen AVX512‑FP16. I versionen ingår också nya binärfiler för macOS, iOS och flera Linux-varianter.
Varför det spelar roll
Det gör att utvecklare kan köra LLM:er snabbare på moderna processorer utan att försämra den numeriska kvaliteten.