Oossa

llama.cpp увеличила буфер по умолчанию и добавила поддержку Hexagon

В библиотеке с открытым исходным кодом llama.cpp устройства Hexagon теперь могут разбивать большие тензоры на несколько буферов, а размер динамического буфера по умолчанию увеличен до 512 MB.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Проект llama.cpp выпустил версию b11490 2026‑10‑08. В ней добавлена поддержка API Hexagon «alloc_buffer_n», позволяющего разбивать большие тензоры на несколько буферов. Размер динамического буфера по умолчанию увеличен со 128 MB до 512 MB, чтобы избежать падения производительности при работе с большими моделями. Новый флаг «--no-embd-offload» упрощает командную строку для устройств, которые не могут переносить вычисления с эмбеддингами. Изменения также подготовил Jhen‑Jie Hong.

Почему это важно

Разработчики, использующие оборудование на базе Hexagon, смогут эффективнее запускать более крупные языковые модели без ручной настройки буфера.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.