Заметка · 1 мин чтения
Сравнение чекпойнтов предобучения при одинаковых настройках
Для каждого чекпойнта на всех трёх последующих этапах — промежуточном обучении, адаптации к длинному контексту и SFT — используется одна и та же схема настроек скорости обучения.
Oossa · Об Oossa
Какую схему выбрали
Мы проверили девять возможных сочетаний (m, ℓ), где m и ℓ — множители скорости обучения для промежуточного обучения и адаптации к длинному контексту, выбранные из набора {1, 1/3, 1/9}; множитель для SFT при этом оставался фиксированным: s = 1/3. Проверку проводили на чекпойнте **Cooldown**. Наивысший совокупный результат по бенчмаркам после SFT показало сочетание **(1, 1)(1, 1)**.
Почему для всех чекпойнтов используется одна и та же схема
Ограничения учебной инфраструктуры не позволили нам отдельно подобрать расписание скорости обучения для каждого чекпойнта предобучения, поэтому мы применили схему **(1, 1)(1, 1)** ко всем чекпойнтам (Constant, Cooldown и Merge). Так мы обеспечили *одинаковые* настройки последующего обучения: различия в итоговых результатах можно объяснить качеством самого чекпойнта предобучения, а не различиями в расписании дообучения.
Почему это важно
Использование одной и той же наиболее эффективной схемы для всех чекпойнтов делает сравнение справедливым: меняется только качество самого чекпойнта предобучения, а не расписание скорости обучения на последующих этапах.
Источники и ссылки
| # | Источник | Издание | Дата | Главное |
|---|---|---|---|---|
| 1 | Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗ | Aleph Alpha | 29 сент. 2026 г. |
1 источников
Обновлено:
Oossa · Рассылка
Неделя ИИ — простыми словами
Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.