تیم ggml‑org نسخهٔ b11480 از llama.cpp را در 2026‑10‑08 منتشر کرد. این بهروزرسانی حافظهٔ نهانی برای متخصصان MoE اضافه میکند که در حافظهٔ میزبان قرار دارد و به اجرای سریعتر مدلهای بزرگ روی GPUها کمک میکند. در توضیحات این تغییر، عبارت assisted‑by Claude درج شده و از API جدید llama_moe_cache_ptr استفاده میشود. فایلهای اجرایی ازپیشساخته برای macOS، iOS و چند پیکربندی Ubuntu برای دانلود در دسترساند.
چرا مهم است
توسعهدهندگان اکنون میتوانند مدلهای MoE را با کارایی بیشتری روی GPUهای مصرفی اجرا کنند و هزینهٔ سختافزار پروژههای هوش مصنوعی را کاهش دهند.