# Сравнение чекпойнтов предобучения при одинаковых настройках

> Для каждого чекпойнта на всех трёх последующих этапах — промежуточном обучении, адаптации к длинному контексту и SFT — используется одна и та же схема настроек скорости обучения.

Oossa · 2026-09-29 · https://oossa.com/ru/matched-recipe-comparison-of-pre-training-checkpoints

## Какую схему выбрали

Мы проверили девять возможных сочетаний (m, ℓ), где m и ℓ — множители скорости обучения для промежуточного обучения и адаптации к длинному контексту, выбранные из набора {1, 1/3, 1/9}; множитель для SFT при этом оставался фиксированным: s = 1/3. Проверку проводили на чекпойнте **Cooldown**. Наивысший совокупный результат по бенчмаркам после SFT показало сочетание **(1, 1)(1, 1)**.

## Почему для всех чекпойнтов используется одна и та же схема

Ограничения учебной инфраструктуры не позволили нам отдельно подобрать расписание скорости обучения для каждого чекпойнта предобучения, поэтому мы применили схему **(1, 1)(1, 1)** ко всем чекпойнтам (Constant, Cooldown и Merge). Так мы обеспечили *одинаковые* настройки последующего обучения: различия в итоговых результатах можно объяснить качеством самого чекпойнта предобучения, а не различиями в расписании дообучения.

## Факты

- Множитель для промежуточного обучения: m = 1
- Множитель для длинного контекста: ℓ = 1
- Множитель для SFT: s = 1/3
- Схему выбрали, поскольку на чекпойнте Cooldown она дала наивысший совокупный результат после SFT.

## Почему это важно

Использование одной и той же наиболее эффективной схемы для всех чекпойнтов делает сравнение справедливым: меняется только качество самого чекпойнта предобучения, а не расписание скорости обучения на последующих этапах.

## Источники и ссылки

1. [Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack](https://www.aleph-alpha.com/en/blog/good-pretraining-bad-sft/) – Aleph Alpha, 2026-09-29

Обновлено: 2026-09-29
