# LRCC добавляет выбор вычислений для каждого токена в сжатые LLM

> Новый метод LRCC позволяет моделям Llama и Qwen выбирать более экономичный или более мощный путь обработки для каждого токена, повышая точность без дополнительного оборудования.

Oossa · 2026-10-08 · https://oossa.com/ru/lrcc-adds-token-dependent-computation-to-low-rank-compressed-llms

Исследователи представили Low-Rank Conditional Computation (LRCC) — метод, который повышает интеллектуальные возможности сжатых языковых моделей. В каждый блок Transformer добавляется небольшой маршрутизатор, который выбирает один из нескольких низкоранговых путей в зависимости от текущего токена. Обучают только маршрутизаторы, а низкоранговые матрицы остаются замороженными. В тестах на Llama‑2‑7B, Llama‑3.2‑1B и Qwen LRCC повысил точность на последующих задачах для Llama‑2‑7B на 7.6 процентного пункта по сравнению со статическим низкоранговым сжатием, а также улучшил перплексию при той же скорости генерации.

## Факты

- Рост средней точности на последующих задачах для Llama‑2‑7B на 7.6 процентного пункта
- Статья опубликована 2026‑10‑08

## Почему это важно

Разработчики смогут запускать более экономичные модели, которые адаптируют вычисления к каждому токену и сохраняют точность, снижая затраты на вычисления в приложениях на базе Llama или Qwen.

## Источники и ссылки

1. [LRCC: Generalizing Low-Rank Compression with Conditional Computation](https://arxiv.org/abs/2610.08858) – arXiv, 2026-10-08

Обновлено: 2026-10-08
