Das Projekt ggml‑org/llama.cpp hat am 2026‑10‑09 Version b11530 veröffentlicht. Die Änderung hält den Backend-Sampling-Graphen über alle Ubatches hinweg statisch, sodass sich seine Form während der Reserve- und Decodierschritte nicht mehr ändert. Damit werden Abstürze behoben, die auftraten, wenn sich die Graph-Topologie nach einem Reserve-Aufbau verschob. Die Fehlerbehebung gilt für alle aufgeführten Builds – macOS, Linux, Android, Windows und openEuler – sowie für alle Hardware-Backends wie CUDA, Vulkan und OpenCL.
Warum es wichtig ist
Entwickler, die llama.cpp verwenden, werden bei der Ausführung von Generierungen mit mehreren Ausgaben auf allen unterstützten CPUs und GPUs weniger Laufzeitfehler erleben.