# llama.cpp ne remplace plus les requêtes en cours

> La version du 10 oct. 2026 corrige un bug qui pouvait corrompre une génération en cours en réécrivant le cache de prompt.

Oossa · 2026-10-10 · https://oossa.com/fr/llama-cpp-update-stops-overwriting-busy-slots

Le projet llama.cpp a publié la version b11552 le 2026‑10‑10. Cette mise à jour empêche une requête de modifier le cache de prompt d’un emplacement déjà occupé. Auparavant, cet emplacement était écrasé, ce qui amenait la génération à se poursuivre avec un contexte erroné. Désormais, l’emplacement occupé reste inchangé et la nouvelle requête attend qu’il soit libre.

## Les faits

- Version b11552 publiée le sam. 10 oct. 2026
- Le correctif empêche la mise à jour du cache de prompt d’un id_slot occupé

## Pourquoi c'est important

Les développeurs qui utilisent llama.cpp constateront moins d’erreurs de génération lorsque plusieurs requêtes partagent la même mémoire GPU.

## Sources et références

1. [ggml-org/llama.cpp b11552](https://github.com/ggml-org/llama.cpp/releases/tag/b11552) – llama.cpp, 2026-10-10

Dernière mise à jour: 2026-10-10
