I ricercatori hanno presentato Low-Rank Conditional Computation (LRCC), un metodo per rendere più intelligenti i modelli linguistici compressi. Ogni blocco Transformer riceve un piccolo router che, in base al token corrente, seleziona uno tra diversi percorsi a basso rango. I router sono gli unici componenti addestrati; le matrici a basso rango restano congelate. Nei test con Llama‑2‑7B, Llama‑3.2‑1B e Qwen, LRCC ha migliorato di 7,6 punti l’accuratezza sui task a valle di Llama‑2‑7B rispetto alla compressione statica a basso rango e ha ottenuto una perplessità inferiore alla stessa velocità di decodifica.
Perché conta
Gli sviluppatori possono eseguire modelli più economici e adattivi in base ai token, mantenendo un’elevata accuratezza e riducendo i costi di calcolo nelle applicazioni che usano Llama o Qwen.