Il progetto llama.cpp ha pubblicato la versione b11552 il 2026‑10‑10. La modifica impedisce a una richiesta di aggiornare la cache del prompt di uno slot già occupato. In precedenza, lo slot veniva sovrascritto e la generazione proseguiva con un contesto errato. Ora lo slot occupato resta invariato e la nuova richiesta attende che si liberi.
Perché conta
Gli sviluppatori che usano llama.cpp riscontreranno meno errori di generazione quando più richieste condividono la stessa memoria GPU.