OossaAI는 빠르게 발전하고 있습니다. 저희가 쉽게 설명해 드립니다.
뉴스레터

짧은 소식 · 1 분 읽기

사전 학습 체크포인트의 동일 레시피 비교

각 체크포인트의 세 가지 후속 학습 단계(중간 학습, 긴 문맥 적응, SFT)에 동일한 학습률 레시피를 적용했습니다.

Oossa · Oossa 소개

선택한 레시피

SFT 학습률 계수 s를 1/3으로 고정한 채, 중간 학습과 긴 문맥 학습의 학습률 계수 m과 ℓ을 각각 {1, 1/3, 1/9}에서 선택해 가능한 9가지 조합을 모두 시험했습니다. **Cooldown** 체크포인트에서 실험한 결과, SFT 이후 종합 벤치마크 점수가 가장 높은 조합은 **(1, 1)(1, 1)**이었습니다.

모든 체크포인트에 같은 레시피를 적용한 이유

훈련 인프라의 제약으로 사전 학습 체크포인트마다 별도의 학습률 일정을 조정할 수 없었기 때문에, 모든 체크포인트(Constant, Cooldown, Merge)에 **(1, 1)(1, 1)** 레시피를 적용했습니다. 이렇게 하면 후속 학습 레시피를 *동일하게 맞출* 수 있어, 최종 점수의 차이가 서로 다른 미세 조정 일정이 아니라 사전 학습 체크포인트 자체에서 비롯된 것인지 비교할 수 있습니다.

왜 중요한가

모든 체크포인트에 성능이 가장 좋았던 단일 레시피를 적용하면 공정하게 비교할 수 있습니다. 달라지는 변수는 후속 학습의 학습률 일정이 아니라 사전 학습 체크포인트 자체의 품질뿐입니다.

이 기사가 도움이 되었나요?

출처 및 참고 자료

#출처매체날짜핵심 내용
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha2026. 9. 29.

1 개 출처

최종 업데이트:

Oossallms.txt.md

공유

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.