Oossa

llama.cpp پشتیبانی CUDA از عرض بلوک‌های بیش از 512 را افزود

نسخهٔ Oct 8 2026 کرنل‌های سریع FWHT را اضافه می‌کند که روی پردازنده‌های گرافیکی NVIDIA عرض‌های 1,024 تا 8,192 را پشتیبانی می‌کنند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پروژهٔ llama.cpp نسخهٔ b11482 را در Oct 8 2026 منتشر کرد. این نسخه کرنل‌های CUDA FWHT را اضافه می‌کند که برای عرض بلوک‌های بیش از 512 کار می‌کنند و پشتیبانی از عرض‌های 1,024 تا 8,192 را برای داده‌های FP32 و FP16 گسترش می‌دهند. این تغییر از زیرساخت F16 موجود استفاده می‌کند و آزمون‌ها را روی یک پردازندهٔ گرافیکی A10 با موفقیت پشت سر می‌گذارد. کرنل‌های موجود با عرض warp (64 تا 512) بدون تغییر باقی مانده‌اند.

چرا مهم است

کاربران GPU اکنون می‌توانند با llama.cpp ضرب ماتریس‌هایی با عرض بزرگ‌تر را سریع‌تر اجرا کنند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.