Forskare har presenterat Low-Rank Conditional Computation (LRCC), en metod för att göra komprimerade språkmodeller smartare. Varje Transformer-block får en liten router som väljer mellan flera låg-rangsvägar utifrån den aktuella tokenen. Det är bara routrarna som tränas; låg-rangmatriserna hålls frysta. Tester med Llama‑2‑7B, Llama‑3.2‑1B och Qwen visade att LRCC ökade träffsäkerheten i efterföljande uppgifter med 7,6 procentenheter för Llama‑2‑7B jämfört med statisk låg-rangkomprimering. Metoden gav också lägre perplexity vid samma avkodningshastighet.
Varför det spelar roll
Utvecklare kan köra billigare modeller som anpassar beräkningarna efter varje token utan att tappa träffsäkerhet. Det kan sänka beräkningskostnaderna för tillämpningar som använder Llama eller Qwen.