Oossa

پشتیبانی llama.cpp از کش MoE روی چند GPU

کتابخانه متن‌باز Llama.cpp حالا امکان اجرای مدل‌های آمیخته از متخصصان را روی چند GPU فراهم می‌کند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

تیم ggml‑org در 8 اکتبر 2026 نسخه b11507 از llama.cpp را منتشر کرد. این به‌روزرسانی از کش آمیخته از متخصصان (MoE) پشتیبانی می‌کند که می‌توان آن را میان چند GPU توزیع کرد. به این ترتیب، توسعه‌دهندگان می‌توانند مدل‌های بزرگ‌تر MoE را بدون نیاز به جا دادن همه‌چیز روی یک کارت اجرا کنند. این نسخه همچنین شامل بسته‌های باینری جدید برای macOS، iOS و چند پیکربندی لینوکس، از جمله پشتیبانی از CUDA 12.8 است.

چرا مهم است

توسعه‌دهندگان حالا می‌توانند مدل‌های هوش مصنوعی بزرگ‌تر و توانمندتری را روی سیستم‌های چند GPU اجرا کنند و کارهایی را که با سخت‌افزار شخصی ممکن است گسترش دهند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.