Oossa

LRCC adapte le calcul à chaque token dans les LLM compressés

La méthode LRCC permet aux modèles Llama et Qwen de choisir, token par token, des voies de calcul plus légères ou plus riches, pour gagner en précision sans matériel supplémentaire.

BrèvePar Publié par Oossa: 1 min de lecture

Des chercheurs ont présenté Low-Rank Conditional Computation (LRCC), une méthode destinée à améliorer les modèles de langage compressés. Chaque bloc Transformer est doté d’un petit routeur qui sélectionne parmi plusieurs voies de faible rang en fonction du token traité. Seuls les routeurs sont entraînés ; les matrices de faible rang restent figées. Testée sur Llama‑2‑7B, Llama‑3.2‑1B et Qwen, la méthode LRCC a amélioré de 7.6 points la précision moyenne sur les tâches en aval de Llama‑2‑7B, par rapport à une compression statique de faible rang. Elle a aussi réduit la perplexité à vitesse de décodage égale.

Pourquoi c'est important

Les développeurs peuvent utiliser des modèles moins coûteux, qui adaptent leur calcul à chaque token tout en conservant leur précision, et ainsi réduire les coûts de calcul des applications faisant appel à Llama ou Qwen.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.