Das llama.cpp-Projekt hat am 10.10.2026 Version b11552 veröffentlicht. Die Änderung verhindert, dass eine Anfrage den Prompt-Cache eines bereits belegten Slots aktualisiert. Bislang wurde der belegte Slot überschrieben, sodass die Generierung mit dem falschen Kontext fortgesetzt wurde. Nun bleibt der belegte Slot unverändert, und die neue Anfrage wartet, bis der Slot frei ist.
Warum es wichtig ist
Entwickler, die llama.cpp einsetzen, werden weniger Generierungsfehler erleben, wenn mehrere Anfragen denselben GPU-Speicher nutzen.