أصدر فريق ggml‑org الإصدار b11262 من llama.cpp في 29 سبتمبر 2026. ويضيف التحديث دعم AVX512‑FP16، الذي يحسب الجداءات النقطية بنصف الدقة (f16)، ثم يجمع النتائج بدقة أحادية (f32) لتحسين الدقة. وهذا تغيير منخفض المستوى يسرّع الاستدلال على وحدات CPU التي تدعم مجموعة التعليمات AVX512‑FP16. ويتضمن الإصدار أيضًا ملفات ثنائية جديدة لأنظمة macOS وiOS وعدة إصدارات من Linux.
لماذا يهم
يتيح للمطورين تشغيل نماذج LLM بسرعة أكبر على وحدات CPU الحديثة من دون التأثير في الدقة العددية.