# LRCC adapta o cálculo por token em LLMs compactos

> O novo método LRCC permite que modelos Llama e Qwen escolham, a cada token, caminhos mais econômicos ou mais avançados, aumentando a precisão sem exigir hardware adicional.

Oossa · 2026-10-08 · https://oossa.com/pt/lrcc-adds-token-dependent-computation-to-low-rank-compressed-llms

Pesquisadores apresentaram o Low-Rank Conditional Computation (LRCC), um método para tornar modelos de linguagem comprimidos mais inteligentes. Cada bloco Transformer recebe um pequeno roteador que escolhe entre vários caminhos de baixa dimensão com base no token atual. Apenas os roteadores são treinados; as matrizes de baixa dimensão permanecem congeladas. Testado no Llama‑2‑7B, no Llama‑3.2‑1B e no Qwen, o LRCC elevou em 7,6 pontos a precisão em tarefas posteriores no Llama‑2‑7B em comparação com a compressão estática de baixa dimensão e obteve menor perplexidade na mesma velocidade de decodificação.

## Os fatos

- Aumento de 7,6 pontos percentuais na precisão média em tarefas posteriores no Llama‑2‑7B
- Artigo publicado em 2026‑10‑08

## Por que importa

Desenvolvedores podem executar modelos mais econômicos e adaptáveis a cada token sem perder precisão, reduzindo os custos computacionais de aplicações que usam Llama ou Qwen.

## Fontes e referências

1. [LRCC: Generalizing Low-Rank Compression with Conditional Computation](https://arxiv.org/abs/2610.08858) – arXiv, 2026-10-08

Última atualização: 2026-10-08
