Проект llama.cpp выпустил патч, меняющий загрузку 32-битных чисел с плавающей точкой (F32) в коде Vulkan. На GPU Intel быстрее загружать по два числа за раз, поэтому в процедуре mul_mat_vec теперь используется загрузка с выравниванием на 2. Изменение также добавляет недостающую проверку выравнивания. Тесты на стенде B60 показали производительность до 1,63 TFLOPS для матриц определённых размеров — заметно выше, чем в предыдущей версии.
Почему это важно
Более быстрые вычисления на GPU ускоряют вывод LLM для пользователей llama.cpp на оборудовании Intel.