Le projet llama.cpp a publié la version b11552 le 2026‑10‑10. Cette mise à jour empêche une requête de modifier le cache de prompt d’un emplacement déjà occupé. Auparavant, cet emplacement était écrasé, ce qui amenait la génération à se poursuivre avec un contexte erroné. Désormais, l’emplacement occupé reste inchangé et la nouvelle requête attend qu’il soit libre.
Pourquoi c'est important
Les développeurs qui utilisent llama.cpp constateront moins d’erreurs de génération lorsque plusieurs requêtes partagent la même mémoire GPU.