# llama.cpp پشتیبانی CUDA از عرض بلوک‌های بیش از 512 را افزود

> نسخهٔ Oct 8 2026 کرنل‌های سریع FWHT را اضافه می‌کند که روی پردازنده‌های گرافیکی NVIDIA عرض‌های 1,024 تا 8,192 را پشتیبانی می‌کنند.

Oossa · 2026-10-08 · https://oossa.com/fa/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

پروژهٔ llama.cpp نسخهٔ b11482 را در Oct 8 2026 منتشر کرد. این نسخه کرنل‌های CUDA FWHT را اضافه می‌کند که برای عرض بلوک‌های بیش از 512 کار می‌کنند و پشتیبانی از عرض‌های 1,024 تا 8,192 را برای داده‌های FP32 و FP16 گسترش می‌دهند. این تغییر از زیرساخت F16 موجود استفاده می‌کند و آزمون‌ها را روی یک پردازندهٔ گرافیکی A10 با موفقیت پشت سر می‌گذارد. کرنل‌های موجود با عرض warp (64 تا 512) بدون تغییر باقی مانده‌اند.

## حقایق

- برچسب انتشار b11482، منتشرشده در Oct 8 2026
- کرنل‌های جدید از عرض‌های 1,024 تا 8,192 برای FP32 و FP16 پشتیبانی می‌کنند

## چرا مهم است

کاربران GPU اکنون می‌توانند با llama.cpp ضرب ماتریس‌هایی با عرض بزرگ‌تر را سریع‌تر اجرا کنند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

آخرین به‌روزرسانی: 2026-10-08
