Un equipo liderado por Arip Asadulaev publicó un método que obliga a los modelos de lenguaje a respetar un formato de salida estricto sin usar memoria adicional. La técnica convierte el formato en un autómata pequeño y aplica la máscara directamente en la GPU. En un Apple M2 Pro de 16 GB, los modelos Qwen‑3.5‑2B y 4B completaron tareas de extracción con esquemas entre 1,2 y 1,3 veces más rápido, usaron solo 3 MB para una gramática en lugar de hasta 1,5 GB y permitieron que un servidor alojara dieciséis gramáticas. Dieciséis agentes paralelos que llamaban a herramientas terminaron sus tareas 2,5 veces antes.
Por qué importa
Los desarrolladores pueden ejecutar más tareas de IA con restricciones en la GPU de una sola laptop y ahorrar tiempo y memoria.