Библиотека ggml‑org/llama.cpp выпустила версию b11475 7 октября 2026 года. В ней исправлена ошибка в бэкенде Metal (графические процессоры Apple): при объединении операций MUL_MAT+ADD выбиралась не та остаточная матрица, из-за чего результаты моделей, выполняющих несколько умножений матриц за один шаг, были неверными. Теперь кодировщик выбирает правильный операнд, и графические процессоры Metal выдают точные результаты.
Почему это важно
Разработчики, использующие llama.cpp на графических процессорах Apple, теперь будут получать надежные результаты работы моделей вместо одинаковых вероятностей.