Oossa

LRCC добавляет выбор вычислений для каждого токена в сжатые LLM

Новый метод LRCC позволяет моделям Llama и Qwen выбирать более экономичный или более мощный путь обработки для каждого токена, повышая точность без дополнительного оборудования.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Исследователи представили Low-Rank Conditional Computation (LRCC) — метод, который повышает интеллектуальные возможности сжатых языковых моделей. В каждый блок Transformer добавляется небольшой маршрутизатор, который выбирает один из нескольких низкоранговых путей в зависимости от текущего токена. Обучают только маршрутизаторы, а низкоранговые матрицы остаются замороженными. В тестах на Llama‑2‑7B, Llama‑3.2‑1B и Qwen LRCC повысил точность на последующих задачах для Llama‑2‑7B на 7.6 процентного пункта по сравнению со статическим низкоранговым сжатием, а также улучшил перплексию при той же скорости генерации.

Почему это важно

Разработчики смогут запускать более экономичные модели, которые адаптируют вычисления к каждому токену и сохраняют точность, снижая затраты на вычисления в приложениях на базе Llama или Qwen.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.