Oossa

Una técnica mejora la cuantización de LLM con menos bits sin coste adicional al inferir

Investigadores proponen Distributionally Robust Quantization (DRQ), un método que ajusta los pesos tras la cuantización posterior al entrenamiento y mejora el rendimiento de varias técnicas.

BrevePor Publicado por Oossa: 1 min de lectura

Un equipo liderado por Zhuo Sun publicó en arXiv un método llamado Distributionally Robust Quantization (DRQ). DRQ ajusta los códigos enteros de los pesos cuantizados para minimizar el peor caso de pérdida de reconstrucción ante distintas distribuciones de activaciones. Se aplica después de la cuantización de pesos posterior al entrenamiento y mantiene intactos tanto la cuadrícula de cuantización como los operadores de inferencia. Los experimentos muestran que DRQ mejora modelos cuantizados previamente con seis métodos, como AWQ, GPTQ y ParoQuant, tanto en LLM densos como en los de mezcla de expertos.

Por qué importa

Permite a los desarrolladores implementar LLM más pequeños y rápidos con mayor precisión, sin cambiar el hardware ni añadir costes durante la ejecución.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.