تیم ggml‑org در ۲۹ سپتامبر ۲۰۲۶ نسخه b11262 از llama.cpp را منتشر کرد. این بهروزرسانی پشتیبانی از AVX512‑FP16 را اضافه میکند؛ مجموعهدستورالعملی که ضرب داخلی با دقت نیمه (f16) را انجام میدهد، اما حاصلها را برای دقت بیشتر با دقت تک (f32) انباشته میکند. این تغییر در سطح پایین، استنتاج را روی پردازندههایی که از مجموعهدستورالعمل AVX512‑FP16 پشتیبانی میکنند، سریعتر میکند. این نسخه همچنین فایلهای اجرایی تازهای برای macOS، iOS و چندین نسخه لینوکس ارائه میدهد.
چرا مهم است
این قابلیت به توسعهدهندگان امکان میدهد مدلهای زبانی بزرگ را روی پردازندههای جدیدتر سریعتر اجرا کنند، بیآنکه از دقت محاسباتی کاسته شود.