Oossa

LRCC maakt low-rank gecomprimeerde LLM’s tokenafhankelijk

Met de nieuwe LRCC-methode kunnen Llama- en Qwen-modellen per token kiezen voor een lichtere of uitgebreidere route. Dat verhoogt de nauwkeurigheid zonder extra hardware.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Onderzoekers introduceerden Low-Rank Conditional Computation (LRCC), een methode om gecomprimeerde taalmodellen slimmer te maken. Elk Transformer-blok krijgt een kleine router die op basis van het huidige token uit meerdere low-rank-routes kiest. Alleen de routers worden getraind; de low-rank-matrices blijven bevroren. Tests met Llama‑2‑7B, Llama‑3.2‑1B en Qwen lieten zien dat LRCC de nauwkeurigheid op downstreamtaken bij Llama‑2‑7B met 7.6 punten verhoogde ten opzichte van statische low-rank-compressie, en bij dezelfde decodeersnelheid een lagere perplexiteit opleverde.

Waarom het ertoe doet

Ontwikkelaars kunnen goedkopere modellen draaien die zich per token aanpassen en nauwkeurig blijven. Dat bespaart rekenkosten voor toepassingen met Llama of Qwen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.