# 카카오, MoE 학습률 예측법과 모델 경량화 기술 발표

> 카카오는 COLM 2026과 TokShop에서 학습 비용을 줄이는 방법과 모델 크기를 낮추는 기술을 공개했다. BBT 비교 실험에서 파라미터 수가 최대 40.4% 줄었다고 밝혔다.

Oossa · 2026-10-08 · https://oossa.com/ko/moe

카카오는 언어모델링 학회 COLM 2026과 토크나이제이션 워크숍 TokShop에서 연구 성과를 발표했다. COLM 논문은 대규모 전문가 혼합(MoE) 모델의 최적 학습률을 전체 학습 비용의 약 1%로 예측하는 방법을 다뤘다. 이 방법은 카카오의 카나나-2.6-155b-a17b 사전학습에 적용돼 10조 토큰 규모의 학습에 활용됐다.

TokShop에서 공개한 BBT는 문자를 바이트 단위로 다루는 경량화 기술이다. 카카오가 제시한 비교 실험에서는 파라미터 수가 20.2~40.4% 감소하고 성능은 2.7~6.6% 개선됐다. 실험의 구체적인 평가 조건은 기사에 제시되지 않았다.

## 팩트

- MoE 학습률 예측법은 전체 학습 비용의 약 1%로 최적값을 예측한다고 카카오가 설명했다.
- BBT 비교 실험에서 파라미터 수는 20.2~40.4% 감소했다.

## 왜 중요한가

기기 내에서 AI를 실행하는 개발자에게 BBT의 파라미터 감소는 메모리 부담을 줄일 가능성이 있지만, 실제 기기에서의 성능이나 적용 조건은 기사만으로 확인할 수 없다.

## 출처 및 참고 자료

1. [카카오, 국제 AI 학회서 MoE 학습 최적화·모델 경량화 성과 공개](https://www.aitimes.com/news/articleView.html?idxno=216073) – AI Times, 2026-10-08

최종 업데이트: 2026-10-08
