Команда ggml-org выпустила llama.cpp версии b11494. В обновлении CUDA-бэкенд теперь назначает каждому warp четыре столбца состояния GDN вместо двух. Эта настройка стала значением по умолчанию. Скачать можно сборки для macOS (Apple Silicon и Intel), iOS и нескольких версий Ubuntu.
Почему это важно
Разработчики, использующие llama.cpp на GPU NVIDIA, могут рассчитывать на более быстрый инференс без изменений в коде.