پروژهٔ llama.cpp نسخهٔ b11552 را در 2026-10-10 منتشر کرد. این تغییر مانع از آن میشود که یک درخواست، حافظهٔ موقت پرامپتِ اسلاتی را که از قبل مشغول است بهروزرسانی کند. پیش از این، محتوای اسلات مشغول بازنویسی میشد و در نتیجه، فرایند تولید با زمینهای نادرست ادامه پیدا میکرد. حالا اسلات مشغول بدون تغییر برگردانده میشود و درخواست تازه تا آزاد شدن اسلات منتظر میماند.
چرا مهم است
توسعهدهندگانی که از llama.cpp استفاده میکنند، هنگام اشتراک چند درخواست در یک حافظهٔ GPU با خطاهای کمتری در تولید روبهرو میشوند.