Oossa

LRCC låter komprimerade språkmodeller anpassa beräkningarna efter varje token

Den nya LRCC-metoden låter Llama- och Qwen-modeller välja enklare eller mer avancerade beräkningsvägar för varje token och ökar träffsäkerheten utan extra hårdvara.

NotisAv Publicerad av Oossa: 1 min läsning

Forskare har presenterat Low-Rank Conditional Computation (LRCC), en metod för att göra komprimerade språkmodeller smartare. Varje Transformer-block får en liten router som väljer mellan flera låg-rangsvägar utifrån den aktuella tokenen. Det är bara routrarna som tränas; låg-rangmatriserna hålls frysta. Tester med Llama‑2‑7B, Llama‑3.2‑1B och Qwen visade att LRCC ökade träffsäkerheten i efterföljande uppgifter med 7,6 procentenheter för Llama‑2‑7B jämfört med statisk låg-rangkomprimering. Metoden gav också lägre perplexity vid samma avkodningshastighet.

Varför det spelar roll

Utvecklare kan köra billigare modeller som anpassar beräkningarna efter varje token utan att tappa träffsäkerhet. Det kan sänka beräkningskostnaderna för tillämpningar som använder Llama eller Qwen.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.