# پشتیبانی llama.cpp از کش MoE روی چند GPU

> کتابخانه متن‌باز Llama.cpp حالا امکان اجرای مدل‌های آمیخته از متخصصان را روی چند GPU فراهم می‌کند.

Oossa · 2026-10-08 · https://oossa.com/fa/llama-cpp-adds-multi-gpu-moe-cache-support

تیم ggml‑org در 8 اکتبر 2026 نسخه b11507 از llama.cpp را منتشر کرد. این به‌روزرسانی از کش آمیخته از متخصصان (MoE) پشتیبانی می‌کند که می‌توان آن را میان چند GPU توزیع کرد. به این ترتیب، توسعه‌دهندگان می‌توانند مدل‌های بزرگ‌تر MoE را بدون نیاز به جا دادن همه‌چیز روی یک کارت اجرا کنند. این نسخه همچنین شامل بسته‌های باینری جدید برای macOS، iOS و چند پیکربندی لینوکس، از جمله پشتیبانی از CUDA 12.8 است.

## حقایق

- نسخه b11507 در 2026-10-08 منتشر شد
- پشتیبانی از کش MoE روی چند GPU اضافه شده است

## چرا مهم است

توسعه‌دهندگان حالا می‌توانند مدل‌های هوش مصنوعی بزرگ‌تر و توانمندتری را روی سیستم‌های چند GPU اجرا کنند و کارهایی را که با سخت‌افزار شخصی ممکن است گسترش دهند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

آخرین به‌روزرسانی: 2026-10-08
