Oossa

به‌روزرسانی llama.cpp مصرف حافظهٔ ایندکسر را نصف می‌کند

نسخهٔ b11372 ایندکسر Qwen4exp را طوری تغییر می‌دهد که برای پردازش‌های طولانی‌متن، بدون افت سرعت، رم بسیار کمتری مصرف کند.

خبر کوتاهOossaمنتشرشده توسط Oossa: 1 دقیقه مطالعه

پروژهٔ ggml‑org/llama.cpp نسخهٔ b11372 را در Oct 3 2026 منتشر کرد. در این به‌روزرسانی، ایندکسر Qwen4exp بازنویسی شده است تا هر سر به‌طور جداگانه امتیاز خود را محاسبه کند و نتایج را در همان محل بنویسد. این تغییر حافظهٔ موردنیاز برای بافرهای امتیاز ایندکسر را که در نمودارهای دارای متن طولانی بیشترین مصرف حافظه را داشتند، به نصف می‌رساند. این تغییر سرعت محاسبات را کاهش نمی‌دهد و پشتیبانی از ایندکسر جدید lightning را نیز به بک‌اندهای CUDA، Metal و Vulkan اضافه می‌کند.

چرا مهم است

توسعه‌دهندگانی که مدل‌های زبانی بزرگ را با متن‌های طولانی اجرا می‌کنند، می‌توانند با همان سخت‌افزار از ورودی‌های بزرگ‌تری استفاده کنند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.