Oossa

Yeni çıkarım yöntemi dil modeli çıktılarını hızlandırıyor

Araştırmacılar, JSON ve araç çağrısı üretimini 1,2–1,3 kat hızlandırırken gramer boyutunu büyük ölçüde küçülten, az bellek kullanan bir motor geliştirdi.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

Arip Asadulaev liderliğindeki ekip, dil modellerinin ek bellek kullanmadan katı bir çıktı biçimine uymasını sağlayan bir yöntem yayımladı. Teknik, biçimi küçük bir otomat olarak yeniden yazıyor ve maskeleme işlemini doğrudan GPU’da yürütüyor. 16 GB’lık Apple M2 Pro’da Qwen‑3.5‑2B ve 4B modelleri, şema kısıtlamalı bilgi çıkarma işlemlerini yaklaşık 1,2–1,3 kat daha hızlı tamamladı. Gramer için 1,5 GB’a kadar bellek yerine yalnızca 3 MB kullandı ve bir sunucunun on altı grameri barındırmasını sağladı. Paralel çalışan on altı araç çağıran ajan da görevlerini 2,5 kat daha kısa sürede tamamladı.

Neden önemli

Geliştiriciler, tek bir dizüstü bilgisayar GPU’sunda daha fazla kısıtlı yapay zekâ görevi çalıştırarak zamandan ve bellekten tasarruf edebilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.