Uma equipe liderada por Zhuo Sun publicou no arXiv um método chamado Distributionally Robust Quantization (DRQ). A DRQ ajusta os códigos inteiros dos pesos quantizados para minimizar a perda de reconstrução no pior caso, considerando diferentes distribuições de ativações. O método é aplicado após a quantização pós-treinamento apenas dos pesos e mantém inalterados a grade de quantização e os operadores de inferência. Os experimentos mostram que a DRQ melhora modelos já quantizados por seis métodos, como AWQ, GPTQ e ParoQuant, tanto em LLMs densos quanto em modelos de mistura de especialistas.
Por que importa
A técnica permite que desenvolvedores implantem LLMs menores e mais rápidos com maior precisão, sem trocar o hardware nem adicionar custos durante a execução.