Arip Asadulaev liderliğindeki ekip, dil modellerinin ek bellek kullanmadan katı bir çıktı biçimine uymasını sağlayan bir yöntem yayımladı. Teknik, biçimi küçük bir otomat olarak yeniden yazıyor ve maskeleme işlemini doğrudan GPU’da yürütüyor. 16 GB’lık Apple M2 Pro’da Qwen‑3.5‑2B ve 4B modelleri, şema kısıtlamalı bilgi çıkarma işlemlerini yaklaşık 1,2–1,3 kat daha hızlı tamamladı. Gramer için 1,5 GB’a kadar bellek yerine yalnızca 3 MB kullandı ve bir sunucunun on altı grameri barındırmasını sağladı. Paralel çalışan on altı araç çağıran ajan da görevlerini 2,5 kat daha kısa sürede tamamladı.
Neden önemli
Geliştiriciler, tek bir dizüstü bilgisayar GPU’sunda daha fazla kısıtlı yapay zekâ görevi çalıştırarak zamandan ve bellekten tasarruf edebilir.