Pesquisadores apresentaram o Low-Rank Conditional Computation (LRCC), um método para tornar modelos de linguagem comprimidos mais inteligentes. Cada bloco Transformer recebe um pequeno roteador que escolhe entre vários caminhos de baixa dimensão com base no token atual. Apenas os roteadores são treinados; as matrizes de baixa dimensão permanecem congeladas. Testado no Llama‑2‑7B, no Llama‑3.2‑1B e no Qwen, o LRCC elevou em 7,6 pontos a precisão em tarefas posteriores no Llama‑2‑7B em comparação com a compressão estática de baixa dimensão e obteve menor perplexidade na mesma velocidade de decodificação.
Por que importa
Desenvolvedores podem executar modelos mais econômicos e adaptáveis a cada token sem perder precisão, reduzindo os custos computacionais de aplicações que usam Llama ou Qwen.