# llama.cpp انتخاب CUDA top‑k را سریع‌تر کرد

> کتابخانه متن‌باز Llama.cpp حالا برای CUDA top‑k از الگوریتم radix-select استفاده می‌کند؛ این تغییر زمان اجرا را در یک آزمون بزرگ از 5.76 s به 0.94 s کاهش داده است.

Oossa · 2026-10-08 · https://oossa.com/fa/llama-cpp-adds-faster-cuda-top-k-selection

پروژه llama.cpp نسخه جدیدی (b11513) را در Oct 8 2026 منتشر کرد. در این نسخه، روال قبلی CUDA top‑k که برای هر ردیف جداگانه اجرا می‌شد، با روش radix select روی شبکه‌ای از ردیف‌ها جایگزین شده است. در مدل Qwen‑4‑exp و با 34,816 توکن، این تغییر تعداد فراخوانی‌های top‑k را از 1,671,253 اجرا (5,761.8 ms) به 2,329 اجرا (941.8 ms) کاهش می‌دهد. این به‌روزرسانی همچنین انتخاب خودکار بهترین الگوریتم top‑k را بر اساس شکل ماتریس اضافه می‌کند و آستانه‌های مسیرهای bitonic و radix را بهبود می‌دهد.

## حقایق

- تاریخ انتشار: Oct 8 2026 – "PUBLISHED: Thu Oct 08 2026"
- کاهش زمان اجرا در Qwen‑4‑exp: از 5,761.8 ms به 941.8 ms

## چرا مهم است

توسعه‌دهندگانی که مدل‌های زبانی بزرگ را روی پردازنده‌های گرافیکی Nvidia اجرا می‌کنند، می‌توانند انتظار داشته باشند عملیات top‑k حدود شش برابر سریع‌تر انجام شود و در نتیجه استنتاج و آموزش سرعت بگیرد.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

آخرین به‌روزرسانی: 2026-10-08
