Oossa

LRCC adapta o cálculo por token em LLMs compactos

O novo método LRCC permite que modelos Llama e Qwen escolham, a cada token, caminhos mais econômicos ou mais avançados, aumentando a precisão sem exigir hardware adicional.

NotaPor Publicado pelo Oossa: 1 min de leitura

Pesquisadores apresentaram o Low-Rank Conditional Computation (LRCC), um método para tornar modelos de linguagem comprimidos mais inteligentes. Cada bloco Transformer recebe um pequeno roteador que escolhe entre vários caminhos de baixa dimensão com base no token atual. Apenas os roteadores são treinados; as matrizes de baixa dimensão permanecem congeladas. Testado no Llama‑2‑7B, no Llama‑3.2‑1B e no Qwen, o LRCC elevou em 7,6 pontos a precisão em tarefas posteriores no Llama‑2‑7B em comparação com a compressão estática de baixa dimensão e obteve menor perplexidade na mesma velocidade de decodificação.

Por que importa

Desenvolvedores podem executar modelos mais econômicos e adaptáveis a cada token sem perder precisão, reduzindo os custos computacionais de aplicações que usam Llama ou Qwen.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.