Une équipe dirigée par Arip Asadulaev a publié une méthode qui impose aux modèles de langage un format de sortie strict sans mémoire supplémentaire. La technique traduit le format en un automate compact et applique directement le masque sur le GPU. Sur un Apple M2 Pro de 16 GB, les modèles Qwen‑3.5‑2B et 4B ont effectué l’extraction sous contraintes de schéma environ 1.2–1.3× plus rapidement. Ils n’ont utilisé que 3 MB pour une grammaire, contre jusqu’à 1.5 GB, et un serveur a pu héberger seize grammaires. Seize agents parallèles utilisant des appels d’outils ont terminé leurs tâches 2.5× plus vite.
Pourquoi c'est important
Les développeurs peuvent exécuter davantage de tâches d’IA sous contraintes sur le GPU d’un seul ordinateur portable, en économisant du temps et de la mémoire.