Des chercheurs ont présenté Low-Rank Conditional Computation (LRCC), une méthode destinée à améliorer les modèles de langage compressés. Chaque bloc Transformer est doté d’un petit routeur qui sélectionne parmi plusieurs voies de faible rang en fonction du token traité. Seuls les routeurs sont entraînés ; les matrices de faible rang restent figées. Testée sur Llama‑2‑7B, Llama‑3.2‑1B et Qwen, la méthode LRCC a amélioré de 7.6 points la précision moyenne sur les tâches en aval de Llama‑2‑7B, par rapport à une compression statique de faible rang. Elle a aussi réduit la perplexité à vitesse de décodage égale.
Pourquoi c'est important
Les développeurs peuvent utiliser des modèles moins coûteux, qui adaptent leur calcul à chaque token tout en conservant leur précision, et ainsi réduire les coûts de calcul des applications faisant appel à Llama ou Qwen.