Команда ggml-org выпустила llama.cpp версии b11398. В ней добавлена поддержка обработки хвостов BF16, FP16 и FP32 в CPU-бэкенде tinyBLAS на платформах x86. Кроме того, обработку этих хвостов векторизовали, чтобы ускорить вычисления. Доступны готовые бинарные файлы для macOS (Apple Silicon и Intel), iOS и нескольких архитектур Ubuntu. В обновление также вошли изменения тестов, которые обеспечивают точность сравнений с эталонными реализациями.
Почему это важно
Разработчики смогут быстрее запускать инференс больших языковых моделей на обычных процессорах без GPU.