# 사전 학습 체크포인트의 동일 레시피 비교

> 각 체크포인트의 세 가지 후속 학습 단계(중간 학습, 긴 문맥 적응, SFT)에 동일한 학습률 레시피를 적용했습니다.

Oossa · 2026-09-29 · https://oossa.com/ko/matched-recipe-comparison-of-pre-training-checkpoints

## 선택한 레시피

SFT 학습률 계수 s를 1/3으로 고정한 채, 중간 학습과 긴 문맥 학습의 학습률 계수 m과 ℓ을 각각 {1, 1/3, 1/9}에서 선택해 가능한 9가지 조합을 모두 시험했습니다. **Cooldown** 체크포인트에서 실험한 결과, SFT 이후 종합 벤치마크 점수가 가장 높은 조합은 **(1, 1)(1, 1)**이었습니다.

## 모든 체크포인트에 같은 레시피를 적용한 이유

훈련 인프라의 제약으로 사전 학습 체크포인트마다 별도의 학습률 일정을 조정할 수 없었기 때문에, 모든 체크포인트(Constant, Cooldown, Merge)에 **(1, 1)(1, 1)** 레시피를 적용했습니다. 이렇게 하면 후속 학습 레시피를 *동일하게 맞출* 수 있어, 최종 점수의 차이가 서로 다른 미세 조정 일정이 아니라 사전 학습 체크포인트 자체에서 비롯된 것인지 비교할 수 있습니다.

## 팩트

- 중간 학습 계수 m = 1
- 긴 문맥 학습 계수 ℓ = 1
- SFT 계수 s = 1/3
- Cooldown 체크포인트에서 SFT 이후 종합 점수가 가장 높아 선택했습니다.

## 왜 중요한가

모든 체크포인트에 성능이 가장 좋았던 단일 레시피를 적용하면 공정하게 비교할 수 있습니다. 달라지는 변수는 후속 학습의 학습률 일정이 아니라 사전 학습 체크포인트 자체의 품질뿐입니다.

## 출처 및 참고 자료

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

최종 업데이트: 2026-09-29
