Команда ggml-org выпустила новую версию llama.cpp 30 сентября 2026 года. В ней устранена проблема, из-за которой драйвер графического процессора MUSA не задавал CUDA_ARCH и некоторые ядра компилировались пустыми. Патч добавляет корректное определение архитектуры и убирает избыточные проверки. В релиз также вошло множество готовых бинарных сборок: теперь среди них есть версии для CUDA 12.8 и 13.4 на Linux и Windows, а также поддержка различных платформ ARM и Apple Silicon.
Почему это важно
Разработчики теперь могут запускать Llama.cpp на графических процессорах MUSA и с новыми версиями CUDA без ручного применения патчей.