# llama.cpp يسرّع اختيار top‑k على CUDA

> تستخدم مكتبة Llama.cpp مفتوحة المصدر الآن خوارزمية radix-select لاختيار top‑k على CUDA، ما خفّض زمن التنفيذ في اختبار كبير من 5.76 s إلى 0.94 s.

Oossa · 2026-10-08 · https://oossa.com/ar/llama-cpp-adds-faster-cuda-top-k-selection

أصدر مشروع llama.cpp إصدارًا جديدًا (b11513) في Oct 8 2026. ويستبدل الإصدار إجراء CUDA السابق لاختيار top‑k لكل صف بخوارزمية radix select تعمل على شبكة من الصفوف. وعلى نموذج Qwen‑4‑exp عند 34,816 رمزًا، خفّض التغيير عدد مرات تشغيل top‑k من 1,671,253 مرة (5,761.8 ms) إلى 2,329 مرة (941.8 ms). ويضيف التحديث أيضًا اختيارًا تلقائيًا لأفضل خوارزمية top‑k بحسب شكل المصفوفة، ويحسّن الحدود الفاصلة لمساري bitonic وradix.

## الحقائق

- تاريخ الإصدار: Oct 8 2026 – "PUBLISHED: Thu Oct 08 2026"
- انخفاض زمن التنفيذ على Qwen‑4‑exp: من 5,761.8 ms إلى 941.8 ms

## لماذا يهم

يمكن للمطورين الذين يشغّلون نماذج لغوية كبيرة على وحدات Nvidia GPU توقع تسريع عمليات top‑k بنحو ستة أضعاف، ما يسرّع الاستدلال والتدريب.

## المصادر والمراجع

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

آخر تحديث: 2026-10-08
