Projektet llama.cpp släppte version b11490 den 2026‑10‑08. Den lägger till stöd för Hexagons API ”alloc_buffer_n”, vilket gör det möjligt att dela upp stora tensorer på flera buffertar. Den dynamiska standardbuffertens storlek höjs från 128 MB till 512 MB för att undvika prestandaförsämringar med stora modeller. En ny flagga, ”--no-embd-offload”, förenklar kommandorader för enheter som inte kan avlasta embeddingar. Ändringarna har tagits fram gemensamt med Jhen‑Jie Hong.
Varför det spelar roll
Utvecklare som använder Hexagon-baserad hårdvara kan köra större språkmodeller effektivare utan att behöva justera buffertar manuellt.