# تحديث llama.cpp يخفض استهلاك الذاكرة للنصف

> يعيد إصدار b11372 تصميم مفهرس Qwen4exp لاستخدام قدر أقل بكثير من ذاكرة RAM، من دون التأثير في السرعة، عند تشغيل النماذج بسياقات طويلة.

Oossa · 2026-10-03 · https://oossa.com/ar/llama-cpp-update-cuts-indexer-memory-use-in-half

أصدر مشروع ggml‑org/llama.cpp الإصدار b11372 في 3 أكتوبر 2026. ويعيد التحديث كتابة مفهرس Qwen4exp بحيث يحسب كل رأس درجته على حدة ويكتب النتائج في مكانها. ويؤدي ذلك إلى خفض الذاكرة اللازمة لمخازن درجات المفهرس إلى النصف، وهي أكبر مستهلك للذاكرة في الرسوم البيانية ذات السياقات الطويلة. ولا يؤثر هذا التغيير في سرعة المعالجة، كما يضيف دعمًا لمفهرس lightning الجديد على الواجهات الخلفية CUDA وMetal وVulkan.

## الحقائق

- نُشر الإصدار b11372 يوم السبت 3 أكتوبر 2026
- انخفض استهلاك ذاكرة درجات المفهرس بنحو 50٪

## لماذا يهم

سيتمكن المطورون الذين يشغّلون نماذج لغوية كبيرة بسياقات طويلة من إدخال مطالبات أكبر على الأجهزة نفسها.

## المصادر والمراجع

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

آخر تحديث: 2026-10-03
