Oossa

llama.cpp v0.1.11534 بهینه‌سازی‌هایی برای کپی در CUDA دارد

این کتابخانه متن‌باز اجرای LLaMA با حذف جابه‌جایی‌های اضافی حافظه GPU، سربار برخی پردازش‌ها را کاهش می‌دهد.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

تیم ggml-org در 2026-10-09 نسخه b11534 از llama.cpp را منتشر کرد. این به‌روزرسانی کپی‌های مربوط به ذخیرهٔ وضعیت را با حافظهٔ نهان بازگشتی ادغام می‌کند و در حالت K = 1، یعنی رمزگشایی بدون حدس، کپی‌های اضافی CUDA را حذف می‌کند. این تغییر فقط به بک‌اند CUDA محدود است؛ بنابراین نسخه‌های CPU و Vulkan تغییری نمی‌کنند. فایل‌های باینری ازپیش‌ساخته برای macOS، iOS و چند نسخهٔ Ubuntu برای دانلود در دسترس‌اند.

کاربرانی که نسخهٔ CUDA را اجرا می‌کنند باید شاهد کاهش اندک ترافیک حافظهٔ GPU باشند؛ این بهبود می‌تواند سرعت را روی سخت‌افزارهای پشتیبانی‌شده افزایش دهد.

چرا مهم است

کاربران CUDA ممکن است با سریع‌تر شدن اجرای استنتاج روبه‌رو شوند، چون کتابخانه اکنون داده‌های کمتری را در GPU جابه‌جا می‌کند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.