Oossa

llama.cpp يسرّع اختيار top‑k على CUDA

تستخدم مكتبة Llama.cpp مفتوحة المصدر الآن خوارزمية radix-select لاختيار top‑k على CUDA، ما خفّض زمن التنفيذ في اختبار كبير من 5.76 s إلى 0.94 s.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

أصدر مشروع llama.cpp إصدارًا جديدًا (b11513) في Oct 8 2026. ويستبدل الإصدار إجراء CUDA السابق لاختيار top‑k لكل صف بخوارزمية radix select تعمل على شبكة من الصفوف. وعلى نموذج Qwen‑4‑exp عند 34,816 رمزًا، خفّض التغيير عدد مرات تشغيل top‑k من 1,671,253 مرة (5,761.8 ms) إلى 2,329 مرة (941.8 ms). ويضيف التحديث أيضًا اختيارًا تلقائيًا لأفضل خوارزمية top‑k بحسب شكل المصفوفة، ويحسّن الحدود الفاصلة لمساري bitonic وradix.

لماذا يهم

يمكن للمطورين الذين يشغّلون نماذج لغوية كبيرة على وحدات Nvidia GPU توقع تسريع عمليات top‑k بنحو ستة أضعاف، ما يسرّع الاستدلال والتدريب.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.