Oossa

نسخه b11494 از llama.cpp بهینه‌سازی CUDA را اضافه کرد

کتابخانه متن‌باز Llama.cpp اکنون در هر وارپ CUDA از چهار ستون حالت GDN استفاده می‌کند تا عملکرد GPU بهتر شود.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

تیم ggml‑org نسخه b11494 از llama.cpp را منتشر کرد. در این به‌روزرسانی، بک‌اند CUDA به‌جای دو ستون، چهار ستون حالت GDN را به هر وارپ اختصاص می‌دهد. این تنظیم اکنون به‌صورت پیش‌فرض فعال است. فایل‌های اجرایی برای macOS (Apple Silicon و Intel)، iOS و چند نسخه از Ubuntu برای دانلود در دسترس‌اند.

چرا مهم است

توسعه‌دهندگانی که llama.cpp را روی GPUهای NVIDIA اجرا می‌کنند، می‌توانند بدون تغییر کد خود انتظار استنتاج سریع‌تری داشته باشند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.