نشر فريق بقيادة أريب أسادولاييف طريقة تُلزم النماذج اللغوية باتباع تنسيق إخراج صارم من دون ذاكرة إضافية. وتعتمد التقنية على تحويل التنسيق إلى آلة حالات صغيرة، ثم تطبيق قناع القيود مباشرة على وحدة معالجة الرسوميات. وعلى جهاز Apple M2 Pro بذاكرة 16 GB، أنجز نموذجا Qwen‑3.5‑2B و4B مهام الاستخراج المقيّدة بالمخططات بسرعة أكبر بنحو 1.2–1.3×، واستهلكا 3 MB فقط للقواعد بدلًا من حجم يصل إلى 1.5 GB، كما أتاحا للخادم استضافة ستة عشر مخططًا. وأنجز ستة عشر وكيلًا يعملون بالتوازي لاستدعاء الأدوات مهامهم بسرعة أكبر بمقدار 2.5×.
لماذا يهم
يمكن للمطوّرين تشغيل مزيد من مهام الذكاء الاصطناعي المقيّدة على وحدة معالجة رسوميات في حاسوب محمول واحد، مع توفير الوقت والذاكرة.