O projeto llama.cpp lançou a versão b11552 em 2026-10-10. A mudança impede que uma solicitação atualize o cache do prompt de um slot que já está ocupado. Antes, o slot ocupado era sobrescrito, fazendo com que a geração prosseguisse com o contexto errado. Agora, o slot ocupado permanece inalterado, e a nova solicitação aguarda até que ele seja liberado.
Por que importa
Desenvolvedores que usam llama.cpp terão menos erros de geração quando várias solicitações compartilharem a mesma memória da GPU.