# llama.cpp добавила GPU-кэш для экспертов MoE

> Библиотека llama.cpp с открытым исходным кодом теперь хранит данные смеси экспертов (MoE) в кэше GPU, размещённом в оперативной памяти компьютера.

Oossa · 2026-10-08 · https://oossa.com/ru/llama-cpp-adds-gpu-cache-for-moe-experts

Команда ggml‑org выпустила llama.cpp версии b11480 2026‑10‑08. В обновлении появился GPU-кэш для экспертов MoE, который размещается в оперативной памяти компьютера и помогает ускорить работу больших моделей на GPU. В изменении указано, что оно создано при участии Claude; также добавлен новый API llama_moe_cache_ptr. Для скачивания доступны готовые бинарные файлы для macOS, iOS и нескольких конфигураций Ubuntu.

## Факты

- Версия выпуска: b11480
- Дата выпуска: 2026‑10‑08

## Почему это важно

Разработчики смогут эффективнее запускать модели MoE на потребительских GPU, снижая затраты на оборудование для проектов в сфере ИИ.

## Источники и ссылки

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

Обновлено: 2026-10-08
