# به‌روزرسانی llama.cpp مصرف حافظهٔ ایندکسر را نصف می‌کند

> نسخهٔ b11372 ایندکسر Qwen4exp را طوری تغییر می‌دهد که برای پردازش‌های طولانی‌متن، بدون افت سرعت، رم بسیار کمتری مصرف کند.

Oossa · 2026-10-03 · https://oossa.com/fa/llama-cpp-update-cuts-indexer-memory-use-in-half

پروژهٔ ggml‑org/llama.cpp نسخهٔ b11372 را در Oct 3 2026 منتشر کرد. در این به‌روزرسانی، ایندکسر Qwen4exp بازنویسی شده است تا هر سر به‌طور جداگانه امتیاز خود را محاسبه کند و نتایج را در همان محل بنویسد. این تغییر حافظهٔ موردنیاز برای بافرهای امتیاز ایندکسر را که در نمودارهای دارای متن طولانی بیشترین مصرف حافظه را داشتند، به نصف می‌رساند. این تغییر سرعت محاسبات را کاهش نمی‌دهد و پشتیبانی از ایندکسر جدید lightning را نیز به بک‌اندهای CUDA، Metal و Vulkan اضافه می‌کند.

## حقایق

- برچسب انتشار b11372 در Sat Oct 03 2026 منتشر شد
- حافظهٔ موردنیاز برای امتیازهای ایندکسر حدود ۵۰٪ کاهش یافت

## چرا مهم است

توسعه‌دهندگانی که مدل‌های زبانی بزرگ را با متن‌های طولانی اجرا می‌کنند، می‌توانند با همان سخت‌افزار از ورودی‌های بزرگ‌تری استفاده کنند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

آخرین به‌روزرسانی: 2026-10-03
