# روش تازه، تولید خروجیِ قالب‌مقید مدل‌های زبانی را سریع‌تر می‌کند

> پژوهشگران موتور کم‌حافظه‌ای معرفی کرده‌اند که تولید JSON و فراخوانی ابزار را 1.2–1.3× سریع‌تر می‌کند و حجم دستور زبان را به‌شدت کاهش می‌دهد.

Oossa · 2026-10-08 · https://oossa.com/fa/new-inference-method-speeds-up-schema-constrained-language-model-output

تیمی به سرپرستی Arip Asadulaev روشی منتشر کرده است که مدل‌های زبانی را وادار می‌کند بدون نیاز به حافظهٔ اضافی، از قالب خروجیِ سخت‌گیرانه‌ای پیروی کنند. در این روش، قالب به یک ماشین خودکار کوچک تبدیل می‌شود و ماسک مستقیماً روی GPU اجرا می‌شود. روی Apple M2 Pro با 16 GB حافظه، مدل‌های Qwen‑3.5‑2B و 4B استخراجِ مقید به طرح‌واره را حدود 1.2–1.3× سریع‌تر انجام دادند؛ برای دستور زبان فقط 3 MB حافظه مصرف شد، درحالی‌که این مقدار پیش‌تر تا 1.5 GB می‌رسید، و سرور توانست شانزده دستور زبان را میزبانی کند. شانزده عاملِ موازیِ فراخوانی ابزار نیز کارهایشان را 2.5× زودتر به پایان رساندند.

## حقایق

- تاریخ انتشار: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- افزایش سرعت: استخراج 1.2–1.3× سریع‌تر؛ عامل‌های ابزار 2.5× سریع‌تر؛ حجم دستور زبان 3 MB در برابر 1.5 GB

## چرا مهم است

توسعه‌دهندگان می‌توانند کارهای هوش مصنوعیِ بیشتری را با خروجی مقید روی GPU یک لپ‌تاپ اجرا کنند و در زمان و حافظه صرفه‌جویی کنند.

## منابع و ارجاع‌ها

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

آخرین به‌روزرسانی: 2026-10-08
