# Una técnica mejora la cuantización de LLM con menos bits sin coste adicional al inferir

> Investigadores proponen Distributionally Robust Quantization (DRQ), un método que ajusta los pesos tras la cuantización posterior al entrenamiento y mejora el rendimiento de varias técnicas.

Oossa · 2026-10-09 · https://oossa.com/es/new-technique-improves-low-bit-llm-quantization-without-extra-inference-cost

Un equipo liderado por Zhuo Sun publicó en arXiv un método llamado Distributionally Robust Quantization (DRQ). DRQ ajusta los códigos enteros de los pesos cuantizados para minimizar el peor caso de pérdida de reconstrucción ante distintas distribuciones de activaciones. Se aplica después de la cuantización de pesos posterior al entrenamiento y mantiene intactos tanto la cuadrícula de cuantización como los operadores de inferencia. Los experimentos muestran que DRQ mejora modelos cuantizados previamente con seis métodos, como AWQ, GPTQ y ParoQuant, tanto en LLM densos como en los de mezcla de expertos.

## Los hechos

- Artículo publicado el 2026-10-09 («Fri Oct 09 2026»)
- DRQ ajusta los pesos de seis métodos de PTQ existentes, entre ellos AWQ, GPTQ y ParoQuant

## Por qué importa

Permite a los desarrolladores implementar LLM más pequeños y rápidos con mayor precisión, sin cambiar el hardware ni añadir costes durante la ejecución.

## Fuentes y referencias

1. [When Lower Reconstruction Loss Hurts: Distributionally Robust Refinement for Low-Bit LLM Quantization](https://arxiv.org/abs/2610.11226) – arXiv, 2026-10-09

Última actualización: 2026-10-09
