Oossa

Nova técnica melhora quantização de LLMs sem custo extra na inferência

Pesquisadores propõem a Distributionally Robust Quantization (DRQ), que refina os pesos após a quantização pós-treinamento e melhora o desempenho de vários métodos.

NotaPor Publicado pelo Oossa: 1 min de leitura

Uma equipe liderada por Zhuo Sun publicou no arXiv um método chamado Distributionally Robust Quantization (DRQ). A DRQ ajusta os códigos inteiros dos pesos quantizados para minimizar a perda de reconstrução no pior caso, considerando diferentes distribuições de ativações. O método é aplicado após a quantização pós-treinamento apenas dos pesos e mantém inalterados a grade de quantização e os operadores de inferência. Os experimentos mostram que a DRQ melhora modelos já quantizados por seis métodos, como AWQ, GPTQ e ParoQuant, tanto em LLMs densos quanto em modelos de mistura de especialistas.

Por que importa

A técnica permite que desenvolvedores implantem LLMs menores e mais rápidos com maior precisão, sem trocar o hardware nem adicionar custos durante a execução.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.