Команда ggml-org выпустила llama.cpp версии b11293. В ней добавлены унарные операции, GLU, бинарные операции и операции масштабирования с BF16 (форматом чисел половинной точности) для CPU и CUDA. Кроме того, обновлены ядра CUDA — это устраняет проблему со сборкой BF16. Обновление доступно для многих платформ, включая macOS, Windows, Linux и Android.
Почему это важно
Разработчики смогут быстрее запускать модели llama.cpp на оборудовании с поддержкой BF16, например на новых GPU.