Исследователи представили Low-Rank Conditional Computation (LRCC) — метод, который повышает интеллектуальные возможности сжатых языковых моделей. В каждый блок Transformer добавляется небольшой маршрутизатор, который выбирает один из нескольких низкоранговых путей в зависимости от текущего токена. Обучают только маршрутизаторы, а низкоранговые матрицы остаются замороженными. В тестах на Llama‑2‑7B, Llama‑3.2‑1B и Qwen LRCC повысил точность на последующих задачах для Llama‑2‑7B на 7.6 процентного пункта по сравнению со статическим низкоранговым сжатием, а также улучшил перплексию при той же скорости генерации.
Почему это важно
Разработчики смогут запускать более экономичные модели, которые адаптируют вычисления к каждому токену и сохраняют точность, снижая затраты на вычисления в приложениях на базе Llama или Qwen.