Un equipo liderado por Zhuo Sun publicó en arXiv un método llamado Distributionally Robust Quantization (DRQ). DRQ ajusta los códigos enteros de los pesos cuantizados para minimizar el peor caso de pérdida de reconstrucción ante distintas distribuciones de activaciones. Se aplica después de la cuantización de pesos posterior al entrenamiento y mantiene intactos tanto la cuadrícula de cuantización como los operadores de inferencia. Los experimentos muestran que DRQ mejora modelos cuantizados previamente con seis métodos, como AWQ, GPTQ y ParoQuant, tanto en LLM densos como en los de mezcla de expertos.
Por qué importa
Permite a los desarrolladores implementar LLM más pequeños y rápidos con mayor precisión, sin cambiar el hardware ni añadir costes durante la ejecución.