30 сентября 2026 года проект ggml-org/llama.cpp выпустил предварительную сборку (тег b11272). В ней появилась оптимизация операции конкатенации для Hexagon — распространённого этапа инференса языковых моделей. Изменение сокращает накладные расходы на обработку пакетов и использует более быструю процедуру деления, ускоряя горячий цикл перемещения данных. Обновление входит в более широкий набор сборок для разных платформ, в том числе Android-устройств со Snapdragon и NPU Hexagon.
Почему это важно
Запуск LLM на смартфонах со Snapdragon станет заметно быстрее, а задержка при выполнении задач ИИ непосредственно на устройстве — ниже.