Oossa

추론 비용 없이 저비트 LLM 양자화 성능 높이는 기법

연구진이 사후 학습 양자화 후 가중치를 다듬는 분포 강건 양자화(DRQ)를 제안해 여러 기법의 성능을 높였다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Zhuo Sun이 이끄는 연구팀이 arXiv에 분포 강건 양자화(Distributionally Robust Quantization, DRQ)라는 기법을 공개했다. DRQ는 다양한 활성값 분포에서 최악의 재구성 손실을 최소화하도록 양자화된 가중치의 정수 코드를 조정한다. 가중치 전용 사후 학습 양자화 뒤에 적용되며, 양자화 격자와 추론 연산자는 그대로 유지한다. 실험 결과 DRQ는 AWQ, GPTQ, ParoQuant 등 6가지 기법으로 이미 양자화한 모델의 성능을 높였다. 조밀형 LLM과 전문가 혼합(MoE) LLM 모두에서 효과가 확인됐다.

왜 중요한가

하드웨어를 바꾸거나 실행 중 추가 비용을 들이지 않고도 개발자가 더 작고 빠르면서 정확도 높은 LLM을 배포할 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.