# llama.cpp برای متخصصان MoE حافظهٔ نهان GPU افزود

> کتابخانهٔ متن‌باز llama.cpp اکنون داده‌های ترکیب متخصصان (MoE) را در حافظهٔ نهان GPU و در حافظهٔ میزبان نگه می‌دارد.

Oossa · 2026-10-08 · https://oossa.com/fa/llama-cpp-adds-gpu-cache-for-moe-experts

تیم ggml‑org نسخهٔ b11480 از llama.cpp را در 2026‑10‑08 منتشر کرد. این به‌روزرسانی حافظهٔ نهانی برای متخصصان MoE اضافه می‌کند که در حافظهٔ میزبان قرار دارد و به اجرای سریع‌تر مدل‌های بزرگ روی GPUها کمک می‌کند. در توضیحات این تغییر، عبارت assisted‑by Claude درج شده و از API جدید llama_moe_cache_ptr استفاده می‌شود. فایل‌های اجرایی ازپیش‌ساخته برای macOS، iOS و چند پیکربندی Ubuntu برای دانلود در دسترس‌اند.

## حقایق

- نسخهٔ انتشار: b11480
- تاریخ انتشار: 2026‑10‑08

## چرا مهم است

توسعه‌دهندگان اکنون می‌توانند مدل‌های MoE را با کارایی بیشتری روی GPUهای مصرفی اجرا کنند و هزینهٔ سخت‌افزار پروژه‌های هوش مصنوعی را کاهش دهند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

آخرین به‌روزرسانی: 2026-10-08
