# llama.cpp يضيف ذاكرة تخزين مؤقت لوحدات MoE على GPU

> تخزّن مكتبة llama.cpp مفتوحة المصدر الآن بيانات نماذج مزيج الخبراء (MoE) في ذاكرة تخزين مؤقت على GPU موجودة في ذاكرة المضيف.

Oossa · 2026-10-08 · https://oossa.com/ar/llama-cpp-adds-gpu-cache-for-moe-experts

أصدر فريق ggml‑org الإصدار b11480 من llama.cpp في 2026‑10‑08. ويضيف التحديث ذاكرة تخزين مؤقت على GPU لوحدات MoE، موجودة في ذاكرة المضيف، ما يساعد على تشغيل النماذج الكبيرة بسرعة أكبر على وحدات GPU. ويُشار إلى أن التغيير أُنجز بمساعدة Claude، ويستخدم واجهة برمجة التطبيقات الجديدة llama_moe_cache_ptr. تتوفر للتنزيل ملفات ثنائية مسبقة البناء لأنظمة macOS وiOS وعدة إعدادات من Ubuntu.

## الحقائق

- إصدار البرنامج: b11480
- تاريخ الإصدار: 2026‑10‑08

## لماذا يهم

بات بإمكان المطورين تشغيل نماذج MoE بكفاءة أكبر على وحدات GPU المخصصة للمستهلكين، ما يخفض تكلفة الأجهزة اللازمة لمشروعات الذكاء الاصطناعي.

## المصادر والمراجع

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

آخر تحديث: 2026-10-08
