Команда ggml‑org выпустила llama.cpp версии b11262 29 сентября 2026 года. В обновлении появилась поддержка AVX512‑FP16: библиотека вычисляет скалярные произведения в формате half (f16), накапливая результат в формате single (f32) для повышения точности. Это низкоуровневое изменение ускоряет инференс на CPU с набором инструкций AVX512‑FP16. В релиз также вошли новые бинарные сборки для macOS, iOS и нескольких вариантов Linux.
Почему это важно
Это позволяет разработчикам быстрее запускать LLM на современных CPU без потери точности вычислений.