Het team van ggml-org heeft op 2026-10-09 versie b11528 van llama.cpp uitgebracht. De update zorgt ervoor dat de bibliotheek views van op de host gealloceerde tensors als gewone nodes kan behandelen. Daarmee verdwijnt een eerdere assertfout die optrad bij de optie –split-mode tensor. Ook is de ondersteuning voor SM-tensors op de K2 Horizon-accelerator terug. De wijziging is opgenomen in de officiële GitHub-release en geldt voor alle vermelde platforms, van macOS tot Windows en Linux.
Waarom het ertoe doet
Ontwikkelaars kunnen llama.cpp nu op meer hardware met gesplitste KV-caching gebruiken zonder crashes. Daardoor zijn er meer configuraties beschikbaar voor lokale LLM-inferentie.