Oossa

LRCC introduce calcolo adattivo per token negli LLM compressi

Il nuovo metodo LRCC consente ai modelli Llama e Qwen di scegliere, token per token, percorsi più leggeri o più ricchi, migliorando la precisione senza hardware aggiuntivo.

BreveDi Pubblicato da Oossa: 1 min di lettura

I ricercatori hanno presentato Low-Rank Conditional Computation (LRCC), un metodo per rendere più intelligenti i modelli linguistici compressi. Ogni blocco Transformer riceve un piccolo router che, in base al token corrente, seleziona uno tra diversi percorsi a basso rango. I router sono gli unici componenti addestrati; le matrici a basso rango restano congelate. Nei test con Llama‑2‑7B, Llama‑3.2‑1B e Qwen, LRCC ha migliorato di 7,6 punti l’accuratezza sui task a valle di Llama‑2‑7B rispetto alla compressione statica a basso rango e ha ottenuto una perplessità inferiore alla stessa velocità di decodifica.

Perché conta

Gli sviluppatori possono eseguire modelli più economici e adattivi in base ai token, mantenendo un’elevata accuratezza e riducendo i costi di calcolo nelle applicazioni che usano Llama o Qwen.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.