Oossa

В llama.cpp ускорили деквантизацию весов Q6_K

В версии b11489 ускорили деквантизацию весов Q6_K и увеличили фактор развёртки циклов. Также доступны новые бинарные сборки для macOS, iOS и Linux.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда ggml‑org выпустила llama.cpp версии b11489. В обновлении ускорили деквантизацию весов Q6_K — преобразование сжатых весов модели обратно в числа, пригодные для использования, — и вдвое увеличили фактор развёртки циклов, говорится в примечаниях к выпуску. Теперь доступны готовые бинарные сборки для Apple Silicon, Intel macOS, iOS, а также нескольких конфигураций Ubuntu, включая сборки с Vulkan и CUDA.

Почему это важно

Благодаря более быстрой деквантизации разработчики смогут запускать LLM на том же оборудовании с меньшей задержкой.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.