Oossaهوش مصنوعی به‌سرعت پیشرفت می‌کند. ما آن را ساده توضیح می‌دهیم.

llama.cpp بارگذاری F32 هم‌تراز با ۲ را به Vulkan اینتل افزود

این به‌روزرسانی با بارگذاری هم‌زمان دو عدد اعشاری، سرعت ضرب ماتریسی را در پردازنده‌های گرافیکی اینتل افزایش می‌دهد.

خبر کوتاهOossa1 دقیقه مطالعه

پروژه llama.cpp وصله‌ای منتشر کرده که شیوه بارگذاری اعداد اعشاری ۳۲ بیتی (F32) در کد Vulkan را تغییر می‌دهد. در پردازنده‌های گرافیکی اینتل، بارگذاری هم‌زمان دو عدد اعشاری از بارگذاری تک‌به‌تک سریع‌تر است؛ به همین دلیل، منطق جدید در روتین mul_mat_vec از بارگذاری هم‌تراز با ۲ استفاده می‌کند. این تغییر همچنین بررسی هم‌ترازیِ جامانده را اضافه می‌کند. نتایج بنچمارک روی برد آزمایشی B60 برای برخی اندازه‌های ماتریس، سرعتی تا ۱٫۶۳ ترافلاپس را نشان می‌دهد که نسبت به نسخه قبلی افزایش محسوسی است.

چرا مهم است

محاسبات سریع‌تر روی GPU یعنی استنتاج سریع‌تر مدل‌های زبانی بزرگ برای کاربرانی که llama.cpp را روی سخت‌افزار اینتل اجرا می‌کنند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.

منابع و ارجاع‌ها

#منبعرسانهتاریخنکته اصلی
1ggml-org/llama.cpp b11266 ↗llama.cpp۷ مهر ۱۴۰۵<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp۸ مهر ۱۴۰۵<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 منبع

آخرین به‌روزرسانی: ·Markdown·llms.txt