Oossa

روش تازه، تولید خروجیِ قالب‌مقید مدل‌های زبانی را سریع‌تر می‌کند

پژوهشگران موتور کم‌حافظه‌ای معرفی کرده‌اند که تولید JSON و فراخوانی ابزار را 1.2–1.3× سریع‌تر می‌کند و حجم دستور زبان را به‌شدت کاهش می‌دهد.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

تیمی به سرپرستی Arip Asadulaev روشی منتشر کرده است که مدل‌های زبانی را وادار می‌کند بدون نیاز به حافظهٔ اضافی، از قالب خروجیِ سخت‌گیرانه‌ای پیروی کنند. در این روش، قالب به یک ماشین خودکار کوچک تبدیل می‌شود و ماسک مستقیماً روی GPU اجرا می‌شود. روی Apple M2 Pro با 16 GB حافظه، مدل‌های Qwen‑3.5‑2B و 4B استخراجِ مقید به طرح‌واره را حدود 1.2–1.3× سریع‌تر انجام دادند؛ برای دستور زبان فقط 3 MB حافظه مصرف شد، درحالی‌که این مقدار پیش‌تر تا 1.5 GB می‌رسید، و سرور توانست شانزده دستور زبان را میزبانی کند. شانزده عاملِ موازیِ فراخوانی ابزار نیز کارهایشان را 2.5× زودتر به پایان رساندند.

چرا مهم است

توسعه‌دهندگان می‌توانند کارهای هوش مصنوعیِ بیشتری را با خروجی مقید روی GPU یک لپ‌تاپ اجرا کنند و در زمان و حافظه صرفه‌جویی کنند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.