أصدر فريق ggml‑org الإصدار b11398 من llama.cpp، مضيفًا دعم معالجة المتبقيات من BF16 وFP16 وFP32 في الواجهة الخلفية tinyBLAS الخاصة بالمعالج، على منصات x86. كما تستخدم التغييرات تعليمات المتجهات لمعالجة هذه المتبقيات وتسريع العمليات الحسابية. ويتوفر الإصدار في ملفات ثنائية مُعدّة مسبقًا لأنظمة macOS (Apple Silicon وIntel) وiOS وعدة معماريات من Ubuntu. ويتضمن التحديث تعديلات على الاختبارات لضمان دقة المقارنات عند استخدام التطبيقات المرجعية.
لماذا يهم
بات بإمكان المطورين تشغيل استدلال نماذج اللغة الكبيرة بسرعة أكبر على المعالجات العادية، من دون تسريع بواسطة وحدة معالجة الرسوميات.