تیم ggml‑org در 8 اکتبر 2026 نسخه b11507 از llama.cpp را منتشر کرد. این بهروزرسانی از کش آمیخته از متخصصان (MoE) پشتیبانی میکند که میتوان آن را میان چند GPU توزیع کرد. به این ترتیب، توسعهدهندگان میتوانند مدلهای بزرگتر MoE را بدون نیاز به جا دادن همهچیز روی یک کارت اجرا کنند. این نسخه همچنین شامل بستههای باینری جدید برای macOS، iOS و چند پیکربندی لینوکس، از جمله پشتیبانی از CUDA 12.8 است.
چرا مهم است
توسعهدهندگان حالا میتوانند مدلهای هوش مصنوعی بزرگتر و توانمندتری را روی سیستمهای چند GPU اجرا کنند و کارهایی را که با سختافزار شخصی ممکن است گسترش دهند.