# llama.cpp v0.1.11534 بهینه‌سازی‌هایی برای کپی در CUDA دارد

> این کتابخانه متن‌باز اجرای LLaMA با حذف جابه‌جایی‌های اضافی حافظه GPU، سربار برخی پردازش‌ها را کاهش می‌دهد.

Oossa · 2026-10-09 · https://oossa.com/fa/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

تیم ggml-org در 2026-10-09 نسخه b11534 از llama.cpp را منتشر کرد. این به‌روزرسانی کپی‌های مربوط به ذخیرهٔ وضعیت را با حافظهٔ نهان بازگشتی ادغام می‌کند و در حالت K = 1، یعنی رمزگشایی بدون حدس، کپی‌های اضافی CUDA را حذف می‌کند. این تغییر فقط به بک‌اند CUDA محدود است؛ بنابراین نسخه‌های CPU و Vulkan تغییری نمی‌کنند. فایل‌های باینری ازپیش‌ساخته برای macOS، iOS و چند نسخهٔ Ubuntu برای دانلود در دسترس‌اند.

کاربرانی که نسخهٔ CUDA را اجرا می‌کنند باید شاهد کاهش اندک ترافیک حافظهٔ GPU باشند؛ این بهبود می‌تواند سرعت را روی سخت‌افزارهای پشتیبانی‌شده افزایش دهد.

## حقایق

- نسخهٔ b11534 در 2026-10-09 منتشر شد
- حذف کپی‌های CUDA در حالت K = 1 (بدون رمزگشایی حدسی) اعمال می‌شود

## چرا مهم است

کاربران CUDA ممکن است با سریع‌تر شدن اجرای استنتاج روبه‌رو شوند، چون کتابخانه اکنون داده‌های کمتری را در GPU جابه‌جا می‌کند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
