تیمی به سرپرستی Arip Asadulaev روشی منتشر کرده است که مدلهای زبانی را وادار میکند بدون نیاز به حافظهٔ اضافی، از قالب خروجیِ سختگیرانهای پیروی کنند. در این روش، قالب به یک ماشین خودکار کوچک تبدیل میشود و ماسک مستقیماً روی GPU اجرا میشود. روی Apple M2 Pro با 16 GB حافظه، مدلهای Qwen‑3.5‑2B و 4B استخراجِ مقید به طرحواره را حدود 1.2–1.3× سریعتر انجام دادند؛ برای دستور زبان فقط 3 MB حافظه مصرف شد، درحالیکه این مقدار پیشتر تا 1.5 GB میرسید، و سرور توانست شانزده دستور زبان را میزبانی کند. شانزده عاملِ موازیِ فراخوانی ابزار نیز کارهایشان را 2.5× زودتر به پایان رساندند.
چرا مهم است
توسعهدهندگان میتوانند کارهای هوش مصنوعیِ بیشتری را با خروجی مقید روی GPU یک لپتاپ اجرا کنند و در زمان و حافظه صرفهجویی کنند.