Oossa

تحديث llama.cpp يخفض استهلاك الذاكرة للنصف

يعيد إصدار b11372 تصميم مفهرس Qwen4exp لاستخدام قدر أقل بكثير من ذاكرة RAM، من دون التأثير في السرعة، عند تشغيل النماذج بسياقات طويلة.

خبر موجزOossaنشرته Oossa: 1 دقائق قراءة

أصدر مشروع ggml‑org/llama.cpp الإصدار b11372 في 3 أكتوبر 2026. ويعيد التحديث كتابة مفهرس Qwen4exp بحيث يحسب كل رأس درجته على حدة ويكتب النتائج في مكانها. ويؤدي ذلك إلى خفض الذاكرة اللازمة لمخازن درجات المفهرس إلى النصف، وهي أكبر مستهلك للذاكرة في الرسوم البيانية ذات السياقات الطويلة. ولا يؤثر هذا التغيير في سرعة المعالجة، كما يضيف دعمًا لمفهرس lightning الجديد على الواجهات الخلفية CUDA وMetal وVulkan.

لماذا يهم

سيتمكن المطورون الذين يشغّلون نماذج لغوية كبيرة بسياقات طويلة من إدخال مطالبات أكبر على الأجهزة نفسها.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.