Oossaالذكاء الاصطناعي يتطور بسرعة. نحن نشرحه ببساطة.
النشرة البريدية

خبر موجز · 1 دقائق قراءة

مقارنة نقاط التحقق قبل التدريب باستخدام وصفة موحّدة

تُنفَّذ المراحل الثلاث اللاحقة للتدريب (التدريب المتوسط، والتكيّف مع السياقات الطويلة، والضبط الدقيق الخاضع للإشراف SFT) باستخدام وصفة معدل التعلّم نفسها لكل نقطة تحقق.

Oossa · عن Oossa

الوصفة المختارة

اختبرنا التركيبات التسع الممكنة لـ (m, ℓ)، حيث يمثّل m وℓ عاملي معدل التعلّم للتدريب المتوسط والتكيّف مع السياقات الطويلة، ويأخذ كل منهما إحدى القيم {1، 1/3، 1/9}، مع تثبيت عامل SFT عند s = 1/3. أُجري الاختبار على نقطة التحقق **Cooldown**، وكانت التركيبة التي حققت أعلى نتيجة إجمالية في المعايير بعد SFT هي **(1, 1)(1, 1)**.

لماذا استُخدمت الوصفة نفسها لجميع نقاط التحقق

بسبب القيود المفروضة على البنية التحتية للتدريب، التي حالت دون ضبط جدول منفصل لمعدل التعلّم لكل نقطة تحقق قبل التدريب، اعتمدنا وصفة **(1, 1)(1, 1)** لجميع نقاط التحقق (Constant وCooldown وMerge). وهذا يضمن توحيد وصفة التدريب اللاحق، بحيث تُعزى أي فروق في النتائج النهائية إلى نقطة التحقق الأساسية قبل التدريب، لا إلى اختلاف جدول الضبط الدقيق.

لماذا يهم

إن استخدام وصفة واحدة هي الأفضل أداءً عبر جميع نقاط التحقق يجعل المقارنة عادلة: فالمتغير الوحيد هو جودة نقطة التحقق نفسها قبل التدريب، وليس جدول معدل التعلّم في المراحل اللاحقة.

هل كان هذا المقال مفيدًا؟

المصادر والمراجع

#المصدرالجهة الناشرةالتاريخالخلاصة
1Good Pretraining, Bad SFT: Checkpoint Quality Across the Training Stack ↗Aleph Alpha29‏/09‏/2026

1 مصادر

آخر تحديث:

Oossallms.txt.md

مشاركة

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.