Проект llama.cpp выпустил новую предварительную версию b11517 9 октября 2026 года. В обновлении появился параметр CUDA, который позволяет задавать точность source-1 для вспомогательных функций MMQ — низкоуровневой части GPU-кода. Изменение подписал контрибьютор NVIDIA; оно применяется в сборках для CUDA 12 и 13, доступных для Linux и Windows. В релиз также вошли цели сборки для многих других платформ — от macOS на Apple Silicon до Android на Snapdragon.
Обновление доступно на странице проекта на GitHub и на сайте llama.app.
Почему это важно
Теперь разработчики могут управлять точностью вычислений на GPU в llama.cpp, что может повысить производительность или сократить расход памяти при запуске моделей LLaMA.