Onderzoekers introduceerden Low-Rank Conditional Computation (LRCC), een methode om gecomprimeerde taalmodellen slimmer te maken. Elk Transformer-blok krijgt een kleine router die op basis van het huidige token uit meerdere low-rank-routes kiest. Alleen de routers worden getraind; de low-rank-matrices blijven bevroren. Tests met Llama‑2‑7B, Llama‑3.2‑1B en Qwen lieten zien dat LRCC de nauwkeurigheid op downstreamtaken bij Llama‑2‑7B met 7.6 punten verhoogde ten opzichte van statische low-rank-compressie, en bij dezelfde decodeersnelheid een lagere perplexiteit opleverde.
Waarom het ertoe doet
Ontwikkelaars kunnen goedkopere modellen draaien die zich per token aanpassen en nauwkeurig blijven. Dat bespaart rekenkosten voor toepassingen met Llama of Qwen.