짧은 소식 · 1 분 읽기
사전 학습 체크포인트의 동일 레시피 비교
각 체크포인트의 세 가지 후속 학습 단계(중간 학습, 긴 문맥 적응, SFT)에 동일한 학습률 레시피를 적용했습니다.
Oossa · Oossa 소개
선택한 레시피
SFT 학습률 계수 s를 1/3으로 고정한 채, 중간 학습과 긴 문맥 학습의 학습률 계수 m과 ℓ을 각각 {1, 1/3, 1/9}에서 선택해 가능한 9가지 조합을 모두 시험했습니다. **Cooldown** 체크포인트에서 실험한 결과, SFT 이후 종합 벤치마크 점수가 가장 높은 조합은 **(1, 1)(1, 1)**이었습니다.
모든 체크포인트에 같은 레시피를 적용한 이유
훈련 인프라의 제약으로 사전 학습 체크포인트마다 별도의 학습률 일정을 조정할 수 없었기 때문에, 모든 체크포인트(Constant, Cooldown, Merge)에 **(1, 1)(1, 1)** 레시피를 적용했습니다. 이렇게 하면 후속 학습 레시피를 *동일하게 맞출* 수 있어, 최종 점수의 차이가 서로 다른 미세 조정 일정이 아니라 사전 학습 체크포인트 자체에서 비롯된 것인지 비교할 수 있습니다.
왜 중요한가
모든 체크포인트에 성능이 가장 좋았던 단일 레시피를 적용하면 공정하게 비교할 수 있습니다. 달라지는 변수는 후속 학습의 학습률 일정이 아니라 사전 학습 체크포인트 자체의 품질뿐입니다.
이 기사가 도움이 되었나요?
출처 및 참고 자료
| # | 출처 | 매체 | 날짜 | 핵심 내용 |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 2026. 9. 29. |
1 개 출처
최종 업데이트:
Oossa · 뉴스레터
이번 주 AI, 쉽게 정리
매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.