# Une nouvelle méthode accélère la génération sous contraintes

> Des chercheurs présentent un moteur peu gourmand en mémoire qui accélère de 1.2–1.3× la génération de JSON et d’appels d’outils, tout en réduisant considérablement la taille des grammaires.

Oossa · 2026-10-08 · https://oossa.com/fr/new-inference-method-speeds-up-schema-constrained-language-model-output

Une équipe dirigée par Arip Asadulaev a publié une méthode qui impose aux modèles de langage un format de sortie strict sans mémoire supplémentaire. La technique traduit le format en un automate compact et applique directement le masque sur le GPU. Sur un Apple M2 Pro de 16 GB, les modèles Qwen‑3.5‑2B et 4B ont effectué l’extraction sous contraintes de schéma environ 1.2–1.3× plus rapidement. Ils n’ont utilisé que 3 MB pour une grammaire, contre jusqu’à 1.5 GB, et un serveur a pu héberger seize grammaires. Seize agents parallèles utilisant des appels d’outils ont terminé leurs tâches 2.5× plus vite.

## Les faits

- Publication : 2026-10-08 (« PUBLISHED: Thu Oct 08 2026 »)
- Gain de vitesse : extraction 1.2–1.3× plus rapide ; agents utilisant des outils 2.5× plus rapides ; grammaire de 3 MB contre 1.5 GB

## Pourquoi c'est important

Les développeurs peuvent exécuter davantage de tâches d’IA sous contraintes sur le GPU d’un seul ordinateur portable, en économisant du temps et de la mémoire.

## Sources et références

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Dernière mise à jour: 2026-10-08
