Oossa

Une nouvelle méthode accélère la génération sous contraintes

Des chercheurs présentent un moteur peu gourmand en mémoire qui accélère de 1.2–1.3× la génération de JSON et d’appels d’outils, tout en réduisant considérablement la taille des grammaires.

BrèvePar Publié par Oossa: 1 min de lecture

Une équipe dirigée par Arip Asadulaev a publié une méthode qui impose aux modèles de langage un format de sortie strict sans mémoire supplémentaire. La technique traduit le format en un automate compact et applique directement le masque sur le GPU. Sur un Apple M2 Pro de 16 GB, les modèles Qwen‑3.5‑2B et 4B ont effectué l’extraction sous contraintes de schéma environ 1.2–1.3× plus rapidement. Ils n’ont utilisé que 3 MB pour une grammaire, contre jusqu’à 1.5 GB, et un serveur a pu héberger seize grammaires. Seize agents parallèles utilisant des appels d’outils ont terminé leurs tâches 2.5× plus vite.

Pourquoi c'est important

Les développeurs peuvent exécuter davantage de tâches d’IA sous contraintes sur le GPU d’un seul ordinateur portable, en économisant du temps et de la mémoire.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.