پروژه ggml‑org/llama.cpp نسخه b11530 را در ۲۰۲۶-۱۰-۰۹ منتشر کرد. این تغییر گراف نمونهبرداری بکاند را در همه ubatchها ثابت نگه میدارد؛ بنابراین شکل گراف هنگام مراحل reserve و decode تغییر نمیکند. این اصلاح از کرشهایی جلوگیری میکند که پس از تغییر توپولوژی گراف، بعد از ساخت reserve رخ میدادند. این اصلاح برای همه نسخههای فهرستشده—macOS، Linux، Android، Windows و openEuler—و همه بکاندهای سختافزاری، از جمله CUDA، Vulkan و OpenCL، اعمال میشود.
چرا مهم است
توسعهدهندگانی که از llama.cpp استفاده میکنند، هنگام اجرای تولیدهای چندخروجی روی هر CPU یا GPU پشتیبانیشده با خطاهای زمان اجرا کمتری روبهرو خواهند شد.