OossaИИ быстро развивается. Объясняем просто.

llama.cpp ускорила загрузку F32 для Intel Vulkan

Обновление ускоряет умножение матриц на GPU Intel: теперь за раз загружаются два числа с плавающей точкой.

ЗаметкаOossa1 мин чтения

Проект llama.cpp выпустил патч, меняющий загрузку 32-битных чисел с плавающей точкой (F32) в коде Vulkan. На GPU Intel быстрее загружать по два числа за раз, поэтому в процедуре mul_mat_vec теперь используется загрузка с выравниванием на 2. Изменение также добавляет недостающую проверку выравнивания. Тесты на стенде B60 показали производительность до 1,63 TFLOPS для матриц определённых размеров — заметно выше, чем в предыдущей версии.

Почему это важно

Более быстрые вычисления на GPU ускоряют вывод LLM для пользователей llama.cpp на оборудовании Intel.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1ggml-org/llama.cpp b11266 ↗llama.cpp29 сент. 2026 г.<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 сент. 2026 г.<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 источников

Обновлено: ·Markdown·llms.txt