Oossa

LRCC adapta el cálculo de los LLM comprimidos a cada token

El nuevo método LRCC permite que los modelos Llama y Qwen elijan rutas más económicas o potentes según el token, y mejora la precisión sin hardware adicional.

BrevePor Publicado por Oossa: 1 min de lectura

Un equipo de investigadores presentó Low-Rank Conditional Computation (LRCC), un método para mejorar los modelos de lenguaje comprimidos. Cada bloque Transformer incorpora un pequeño enrutador que, según el token actual, elige entre varias rutas de bajo rango. Los enrutadores son las únicas partes que se entrenan; las matrices de bajo rango permanecen congeladas. En pruebas con Llama‑2‑7B, Llama‑3.2‑1B y Qwen, LRCC aumentó en 7.6 puntos la precisión en tareas posteriores de Llama‑2‑7B frente a la compresión estática de bajo rango y logró una perplejidad menor a la misma velocidad de decodificación.

Por qué importa

Los desarrolladores pueden ejecutar modelos más económicos que adaptan el cálculo a cada token sin perder precisión, lo que reduce los costos computacionales de las aplicaciones que usan Llama o Qwen.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.