# LRCC introduce calcolo adattivo per token negli LLM compressi

> Il nuovo metodo LRCC consente ai modelli Llama e Qwen di scegliere, token per token, percorsi più leggeri o più ricchi, migliorando la precisione senza hardware aggiuntivo.

Oossa · 2026-10-08 · https://oossa.com/it/lrcc-adds-token-dependent-computation-to-low-rank-compressed-llms

I ricercatori hanno presentato Low-Rank Conditional Computation (LRCC), un metodo per rendere più intelligenti i modelli linguistici compressi. Ogni blocco Transformer riceve un piccolo router che, in base al token corrente, seleziona uno tra diversi percorsi a basso rango. I router sono gli unici componenti addestrati; le matrici a basso rango restano congelate. Nei test con Llama‑2‑7B, Llama‑3.2‑1B e Qwen, LRCC ha migliorato di 7,6 punti l’accuratezza sui task a valle di Llama‑2‑7B rispetto alla compressione statica a basso rango e ha ottenuto una perplessità inferiore alla stessa velocità di decodifica.

## I fatti

- Miglioramento di 7,6 punti percentuali nell’accuratezza media sui task a valle con Llama‑2‑7B
- Articolo pubblicato il 2026‑10‑08

## Perché conta

Gli sviluppatori possono eseguire modelli più economici e adattivi in base ai token, mantenendo un’elevata accuratezza e riducendo i costi di calcolo nelle applicazioni che usano Llama o Qwen.

## Fonti e riferimenti

1. [LRCC: Generalizing Low-Rank Compression with Conditional Computation](https://arxiv.org/abs/2610.08858) – arXiv, 2026-10-08

Ultimo aggiornamento: 2026-10-08
