Проект llama.cpp выпустил версию b11552 10 октября 2026 года. Изменение запрещает запросу обновлять кэш промпта в уже занятом слоте. Раньше занятый слот перезаписывался, из-за чего генерация продолжалась с неверным контекстом. Теперь занятый слот остаётся без изменений, а новый запрос ждёт, пока слот освободится.
Почему это важно
Разработчики, использующие llama.cpp, будут реже сталкиваться со сбоями генерации, когда несколько запросов используют одну и ту же память GPU.