Oossa

llama.cpp انتخاب CUDA top‑k را سریع‌تر کرد

کتابخانه متن‌باز Llama.cpp حالا برای CUDA top‑k از الگوریتم radix-select استفاده می‌کند؛ این تغییر زمان اجرا را در یک آزمون بزرگ از 5.76 s به 0.94 s کاهش داده است.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پروژه llama.cpp نسخه جدیدی (b11513) را در Oct 8 2026 منتشر کرد. در این نسخه، روال قبلی CUDA top‑k که برای هر ردیف جداگانه اجرا می‌شد، با روش radix select روی شبکه‌ای از ردیف‌ها جایگزین شده است. در مدل Qwen‑4‑exp و با 34,816 توکن، این تغییر تعداد فراخوانی‌های top‑k را از 1,671,253 اجرا (5,761.8 ms) به 2,329 اجرا (941.8 ms) کاهش می‌دهد. این به‌روزرسانی همچنین انتخاب خودکار بهترین الگوریتم top‑k را بر اساس شکل ماتریس اضافه می‌کند و آستانه‌های مسیرهای bitonic و radix را بهبود می‌دهد.

چرا مهم است

توسعه‌دهندگانی که مدل‌های زبانی بزرگ را روی پردازنده‌های گرافیکی Nvidia اجرا می‌کنند، می‌توانند انتظار داشته باشند عملیات top‑k حدود شش برابر سریع‌تر انجام شود و در نتیجه استنتاج و آموزش سرعت بگیرد.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.