OossaИИ быстро развивается. Объясняем просто.

В pre-release llama.cpp v0.2.0 ускорили работу на Hexagon

В открытом LLM-раннере обновили бэкенд Hexagon: операции конкатенации на чипах Snapdragon стали быстрее.

ЗаметкаOossa1 мин чтения

30 сентября 2026 года проект ggml-org/llama.cpp выпустил предварительную сборку (тег b11272). В ней появилась оптимизация операции конкатенации для Hexagon — распространённого этапа инференса языковых моделей. Изменение сокращает накладные расходы на обработку пакетов и использует более быструю процедуру деления, ускоряя горячий цикл перемещения данных. Обновление входит в более широкий набор сборок для разных платформ, в том числе Android-устройств со Snapdragon и NPU Hexagon.

Почему это важно

Запуск LLM на смартфонах со Snapdragon станет заметно быстрее, а задержка при выполнении задач ИИ непосредственно на устройстве — ниже.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1ggml-org/llama.cpp b11272 ↗llama.cpp30 сент. 2026 г.<details open> hexagon: optimize concat op (#29673) * hex-concat: reduce pkts in gather/transpose hot loop gather directly into dst buffer,

1 источников

Обновлено: ·Markdown·llms.txt