Oossa

llama.cpp برای متخصصان MoE حافظهٔ نهان GPU افزود

کتابخانهٔ متن‌باز llama.cpp اکنون داده‌های ترکیب متخصصان (MoE) را در حافظهٔ نهان GPU و در حافظهٔ میزبان نگه می‌دارد.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: آخرین به‌روزرسانی: 1 دقیقه مطالعه

تیم ggml‑org نسخهٔ b11480 از llama.cpp را در 2026‑10‑08 منتشر کرد. این به‌روزرسانی حافظهٔ نهانی برای متخصصان MoE اضافه می‌کند که در حافظهٔ میزبان قرار دارد و به اجرای سریع‌تر مدل‌های بزرگ روی GPUها کمک می‌کند. در توضیحات این تغییر، عبارت assisted‑by Claude درج شده و از API جدید llama_moe_cache_ptr استفاده می‌شود. فایل‌های اجرایی ازپیش‌ساخته برای macOS، iOS و چند پیکربندی Ubuntu برای دانلود در دسترس‌اند.

چرا مهم است

توسعه‌دهندگان اکنون می‌توانند مدل‌های MoE را با کارایی بیشتری روی GPUهای مصرفی اجرا کنند و هزینهٔ سخت‌افزار پروژه‌های هوش مصنوعی را کاهش دهند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.