Oossa

llama.cpp добавила GPU-кэш для экспертов MoE

Библиотека llama.cpp с открытым исходным кодом теперь хранит данные смеси экспертов (MoE) в кэше GPU, размещённом в оперативной памяти компьютера.

ЗаметкаАвтор: Опубликовано Oossa: Обновлено: 1 мин чтения

Команда ggml‑org выпустила llama.cpp версии b11480 2026‑10‑08. В обновлении появился GPU-кэш для экспертов MoE, который размещается в оперативной памяти компьютера и помогает ускорить работу больших моделей на GPU. В изменении указано, что оно создано при участии Claude; также добавлен новый API llama_moe_cache_ptr. Для скачивания доступны готовые бинарные файлы для macOS, iOS и нескольких конфигураций Ubuntu.

Почему это важно

Разработчики смогут эффективнее запускать модели MoE на потребительских GPU, снижая затраты на оборудование для проектов в сфере ИИ.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.