Un equipo de investigadores presentó Low-Rank Conditional Computation (LRCC), un método para mejorar los modelos de lenguaje comprimidos. Cada bloque Transformer incorpora un pequeño enrutador que, según el token actual, elige entre varias rutas de bajo rango. Los enrutadores son las únicas partes que se entrenan; las matrices de bajo rango permanecen congeladas. En pruebas con Llama‑2‑7B, Llama‑3.2‑1B y Qwen, LRCC aumentó en 7.6 puntos la precisión en tareas posteriores de Llama‑2‑7B frente a la compresión estática de bajo rango y logró una perplejidad menor a la misma velocidad de decodificación.
Por qué importa
Los desarrolladores pueden ejecutar modelos más económicos que adaptan el cálculo a cada token sin perder precisión, lo que reduce los costos computacionales de las aplicaciones que usan Llama o Qwen.