OossaИИ быстро развивается. Мы объясняем это просто.
Рассылка

Заметка · 1 мин чтения

Сравнение чекпойнтов предобучения при одинаковых настройках

Для каждого чекпойнта на всех трёх последующих этапах — промежуточном обучении, адаптации к длинному контексту и SFT — используется одна и та же схема настроек скорости обучения.

Oossa · Об Oossa

Какую схему выбрали

Мы проверили девять возможных сочетаний (m, ℓ), где m и ℓ — множители скорости обучения для промежуточного обучения и адаптации к длинному контексту, выбранные из набора {1, 1/3, 1/9}; множитель для SFT при этом оставался фиксированным: s = 1/3. Проверку проводили на чекпойнте **Cooldown**. Наивысший совокупный результат по бенчмаркам после SFT показало сочетание **(1, 1)(1, 1)**.

Почему для всех чекпойнтов используется одна и та же схема

Ограничения учебной инфраструктуры не позволили нам отдельно подобрать расписание скорости обучения для каждого чекпойнта предобучения, поэтому мы применили схему **(1, 1)(1, 1)** ко всем чекпойнтам (Constant, Cooldown и Merge). Так мы обеспечили *одинаковые* настройки последующего обучения: различия в итоговых результатах можно объяснить качеством самого чекпойнта предобучения, а не различиями в расписании дообучения.

Почему это важно

Использование одной и той же наиболее эффективной схемы для всех чекпойнтов делает сравнение справедливым: меняется только качество самого чекпойнта предобучения, а не расписание скорости обучения на последующих этапах.

Эта статья была полезной?

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29 сент. 2026 г.

1 источников

Обновлено:

Oossallms.txt.md

Поделиться

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.