Het llama.cpp-project bracht op 2026‑10‑10 versie b11552 uit. De wijziging voorkomt dat een verzoek de promptcache bijwerkt van een slot dat al bezet is. Voorheen werd het bezette slot overschreven, waardoor de generatie verderging met de verkeerde context. Nu blijft het bezette slot ongewijzigd en wacht het nieuwe verzoek tot het slot vrijkomt.
Waarom het ertoe doet
Ontwikkelaars die llama.cpp gebruiken, krijgen minder generatiefouten wanneer meerdere verzoeken hetzelfde GPU-geheugen delen.