# llama.cpp ускорила загрузку F32 для Intel Vulkan

> Обновление ускоряет умножение матриц на GPU Intel: теперь за раз загружаются два числа с плавающей точкой.

Oossa · 2026-09-30 · https://oossa.com/ru/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

Проект llama.cpp выпустил патч, меняющий загрузку 32-битных чисел с плавающей точкой (F32) в коде Vulkan. На GPU Intel быстрее загружать по два числа за раз, поэтому в процедуре mul_mat_vec теперь используется загрузка с выравниванием на 2. Изменение также добавляет недостающую проверку выравнивания. Тесты на стенде B60 показали производительность до 1,63 TFLOPS для матриц определённых размеров — заметно выше, чем в предыдущей версии.

## Факты

- Патч выпущен 30 сентября 2026 года (b11266)
- Ускорение — до 1,63 TFLOPS на матрице 4096×8×14336

## Почему это важно

Более быстрые вычисления на GPU ускоряют вывод LLM для пользователей llama.cpp на оборудовании Intel.

## Источники и ссылки

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Обновлено: 2026-09-30
