Проект llama.cpp выпустил версию b11490 2026‑10‑08. В ней добавлена поддержка API Hexagon «alloc_buffer_n», позволяющего разбивать большие тензоры на несколько буферов. Размер динамического буфера по умолчанию увеличен со 128 MB до 512 MB, чтобы избежать падения производительности при работе с большими моделями. Новый флаг «--no-embd-offload» упрощает командную строку для устройств, которые не могут переносить вычисления с эмбеддингами. Изменения также подготовил Jhen‑Jie Hong.
Почему это важно
Разработчики, использующие оборудование на базе Hexagon, смогут эффективнее запускать более крупные языковые модели без ручной настройки буфера.