# llama.cpp добавила поддержку кэша MoE на нескольких GPU

> Открытая библиотека llama.cpp теперь позволяет запускать модели со смесью экспертов на нескольких GPU.

Oossa · 2026-10-08 · https://oossa.com/ru/llama-cpp-adds-multi-gpu-moe-cache-support

Команда ggml‑org выпустила версию llama.cpp b11507 8 октября 2026 года. Обновление добавляет поддержку кэша смеси экспертов (MoE), который можно распределять между несколькими GPU. Благодаря этому разработчики могут запускать более крупные модели MoE, которым не хватило бы памяти одной видеокарты. В релиз также вошли новые бинарные пакеты для macOS, iOS и нескольких конфигураций Linux, включая поддержку CUDA 12.8.

## Факты

- Версия b11507 выпущена 2026-10-08
- Добавлена поддержка кэша MoE на нескольких GPU

## Почему это важно

Теперь разработчики могут запускать более крупные и мощные модели ИИ на системах с несколькими GPU, расширяя возможности персонального оборудования.

## Источники и ссылки

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

Обновлено: 2026-10-08
