حدّث فريق ggml‑org مشروع llama.cpp (الإصدار b11518) في 9 أكتوبر 2026. ويضيف التحديث نوى Flash Attention بدقتَي 128 و96 باستخدام Metal، ما يسرّع الاستدلال على أجهزة Mac المزودة بمعالجات Apple Silicon. تتوفر للتنزيل ملفات تنفيذية جاهزة لأنظمة macOS (arm64) وmacOS لأجهزة Intel وiOS، إضافة إلى عدة إعدادات من Linux.
لماذا يهم
يمكن لمستخدمي أجهزة Apple Silicon تشغيل نماذج LLM بسرعة أكبر من دون شراء عتاد GPU إضافي.