Oossa

llama.cpp добавила поддержку кэша MoE на нескольких GPU

Открытая библиотека llama.cpp теперь позволяет запускать модели со смесью экспертов на нескольких GPU.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда ggml‑org выпустила версию llama.cpp b11507 8 октября 2026 года. Обновление добавляет поддержку кэша смеси экспертов (MoE), который можно распределять между несколькими GPU. Благодаря этому разработчики могут запускать более крупные модели MoE, которым не хватило бы памяти одной видеокарты. В релиз также вошли новые бинарные пакеты для macOS, iOS и нескольких конфигураций Linux, включая поддержку CUDA 12.8.

Почему это важно

Теперь разработчики могут запускать более крупные и мощные модели ИИ на системах с несколькими GPU, расширяя возможности персонального оборудования.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.