Oossa

Nemotron modelleri IOI ve IMO’da altın madalya düzeyine ulaştı

Nemotron‑3’ün ince ayar yapılmış sürümleri, 2026 Uluslararası Bilişim Olimpiyatı ve Uluslararası Matematik Olimpiyatı’nda altın madalya barajını aştı.

Yazan: Oossa yayın tarihi: 1 dk okuma

Nikita Kachanovsky · Unsplash

Hugging Face, Nemotron‑3 temel modelinin iki özel sürümünün 2026 Uluslararası Bilişim Olimpiyatı’nda (IOI) ve 2026 Uluslararası Matematik Olimpiyatı’nda (IMO) altın madalya düzeyinde puan aldığını bildirdi. Nemotron‑3‑Ultra‑CC adlı IOI sistemi 600 üzerinden 535.4 puan aldı. Bu sonuç, 361.12 olan altın madalya barajını ve en yüksek insan puanı olan 498.27’yi rahatça geçti. Nemotron‑3‑Ultra temel alınarak hem denetimli ince ayar (SFT) hem de pekiştirmeli öğrenme (RL) uygulanan IMO sistemi ise 42 üzerinden 30 puan alarak 29 olan resmî altın madalya barajını az farkla aştı.

Araştırmacılar ne yaptı?

Her iki projede de büyük bir Nemotron‑3 temel modeliyle yola çıkıldı, alana özgü problemler derlendi ve standart eğitim sonrası yöntemler uygulandı. IOI için 22,000 programlama problemi seçildi ve sentetik akıl yürütme izleri eklendi; ardından SFT, daha küçük Nano modeline ise ayrıca RL uygulandı. Araştırmacılar ayrıca yanıtları üretip değerlendiren ve geliştiren GenCorrect adlı bir çıkarım döngüsünden yararlandı. IMO için üretim, eleştiri ve doğrulama süreçlerini kapsayan, filtrelenmiş 414,890 kanıt örneğinden oluşan bir derlem hazırlandı; ardından bir kontrol noktası SFT, diğeri RL ile ince ayarlandı. Son IMO sistemi, bu iki kontrol noktasını genel modelle birleştirdi ve kanıtları üretip geliştirmek için üret‑doğrula‑iyileştir hattını kullandı.

Çalışmalara nereden ulaşılabilir?

Tüm modeller, veri kümeleri ve kodlar Hugging Face’te yayımlandı. Nemotron‑3‑Ultra‑CC kontrol noktası indirilebilir durumda; IOI makalesinde ise GenCorrect yöntemi anlatılıyor. IMO projesi, SFT ve RL kontrol noktalarının yanı sıra olimpiyat düzeyinde 200 problem içeren Nemotron‑IMO‑Bench kıyaslama testini ve çıkarım hattı ile istemleri barındıran NeMo‑Skills deposunu içeriyor. Yazarlar, topluluğun “dört parçalı tarifi” yeniden kullanmasını umuyor: güçlü bir temel modelle başlamak, veri derlemek, SFT/RL uygulamak ve geri bildirim odaklı bir çıkarım döngüsü eklemek.

Neden önemli

Geliştiriciler açısından bu sonuçlar, tek bir büyük modelin yeniden üretilebilir bir ince ayar tarifiyle en iyi insan yarışmacılarla yarışabilecek bir uzmana dönüştürülebileceğini gösteriyor. Böylece hobi amaçlı çalışanlar ve araştırma ekipleri, sıfırdan yeni bir temel model eğitmeden yüksek performanslı kod üretme veya kanıt yazma araçları geliştirebilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.