OossaИИ быстро развивается. Объясняем просто.

llama.cpp добавила поддержку AVX512‑FP16 в релизе b11262

Библиотека с открытым исходным кодом llama.cpp теперь использует AVX512‑FP16 для вычисления скалярных произведений в формате half с накоплением в полной точности, повышая производительность на CPU.

ЗаметкаOossa1 мин чтения

Команда ggml‑org выпустила llama.cpp версии b11262 29 сентября 2026 года. В обновлении появилась поддержка AVX512‑FP16: библиотека вычисляет скалярные произведения в формате half (f16), накапливая результат в формате single (f32) для повышения точности. Это низкоуровневое изменение ускоряет инференс на CPU с набором инструкций AVX512‑FP16. В релиз также вошли новые бинарные сборки для macOS, iOS и нескольких вариантов Linux.

Почему это важно

Это позволяет разработчикам быстрее запускать LLM на современных CPU без потери точности вычислений.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1ggml-org/llama.cpp b11262 ↗llama.cpp29 сент. 2026 г.<details open> ggml : accumulate f16 dot products in f32 on AVX512-FP16 (#29545) Supersedes #29530 Signed-off-by: Adrien Gallouët <angt@hugg

1 источников

Обновлено: ·Markdown·llms.txt