أصدر مشروع llama.cpp إصدارًا جديدًا (b11513) في Oct 8 2026. ويستبدل الإصدار إجراء CUDA السابق لاختيار top‑k لكل صف بخوارزمية radix select تعمل على شبكة من الصفوف. وعلى نموذج Qwen‑4‑exp عند 34,816 رمزًا، خفّض التغيير عدد مرات تشغيل top‑k من 1,671,253 مرة (5,761.8 ms) إلى 2,329 مرة (941.8 ms). ويضيف التحديث أيضًا اختيارًا تلقائيًا لأفضل خوارزمية top‑k بحسب شكل المصفوفة، ويحسّن الحدود الفاصلة لمساري bitonic وradix.
لماذا يهم
يمكن للمطورين الذين يشغّلون نماذج لغوية كبيرة على وحدات Nvidia GPU توقع تسريع عمليات top‑k بنحو ستة أضعاف، ما يسرّع الاستدلال والتدريب.