Oossa

بهینه‌سازی پردازش ردیف‌های تکراری در Vulkan به llama.cpp آمد

کتابخانه متن‌باز استنتاج LLaMA حالا هنگام تکرار ردیف‌های GPU از انجام محاسبات اضافی صرف‌نظر می‌کند و روی دستگاه‌های Vulkan سریع‌تر عمل می‌کند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پروژه llama.cpp نسخه b11554 را در 2026‑10‑11 منتشر کرد. این به‌روزرسانی اصلاحاتی ویژه Vulkan دارد که شناسه‌های ردیف تکراری را در ضرب ماتریسی تشخیص می‌دهد و به‌جای پردازش در یک حلقه، آن‌ها را در مرحله‌ای مقدماتی مدیریت می‌کند. همچنین بهینه‌سازی «hoist row ids» را بهبود می‌دهد تا همیشه اجرا شود و بتواند چندین کاشی فشرده تولید کند. این تغییرات به GPU اجازه می‌دهند گروه‌های کاری کمتری اجرا کند و در صورت امکان زودتر کار را متوقف کند.

چرا مهم است

کاربران GPU در llama.cpp می‌توانند از استنتاج سریع‌تری بهره ببرند، چون کتابخانه دیگر محاسبات یکسان را تکرار نمی‌کند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.