Oossa

llama.cpp ускорила tinyBLAS на процессорах x86

В библиотеке llama.cpp с открытым исходным кодом векторизовали обработку хвостов BF16, FP16 и FP32 в бэкенде tinyBLAS, повысив скорость инференса на CPU.

ЗаметкаOossaОпубликовано Oossa: 1 мин чтения

Команда ggml-org выпустила llama.cpp версии b11398. В ней добавлена поддержка обработки хвостов BF16, FP16 и FP32 в CPU-бэкенде tinyBLAS на платформах x86. Кроме того, обработку этих хвостов векторизовали, чтобы ускорить вычисления. Доступны готовые бинарные файлы для macOS (Apple Silicon и Intel), iOS и нескольких архитектур Ubuntu. В обновление также вошли изменения тестов, которые обеспечивают точность сравнений с эталонными реализациями.

Почему это важно

Разработчики смогут быстрее запускать инференс больших языковых моделей на обычных процессорах без GPU.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.