# Un nuevo método acelera la generación de texto con formato restringido

> Un motor de bajo consumo de memoria genera JSON y llamadas a herramientas entre 1,2 y 1,3 veces más rápido y reduce drásticamente el tamaño de las gramáticas.

Oossa · 2026-10-08 · https://oossa.com/es/new-inference-method-speeds-up-schema-constrained-language-model-output

Un equipo liderado por Arip Asadulaev publicó un método que obliga a los modelos de lenguaje a respetar un formato de salida estricto sin usar memoria adicional. La técnica convierte el formato en un autómata pequeño y aplica la máscara directamente en la GPU. En un Apple M2 Pro de 16 GB, los modelos Qwen‑3.5‑2B y 4B completaron tareas de extracción con esquemas entre 1,2 y 1,3 veces más rápido, usaron solo 3 MB para una gramática en lugar de hasta 1,5 GB y permitieron que un servidor alojara dieciséis gramáticas. Dieciséis agentes paralelos que llamaban a herramientas terminaron sus tareas 2,5 veces antes.

## Los hechos

- Publicado: 2026-10-08 («PUBLISHED: Thu Oct 08 2026»)
- Aceleración: extracción entre 1,2 y 1,3 veces más rápida; agentes con herramientas 2,5 veces más rápidos; gramática de 3 MB frente a 1,5 GB

## Por qué importa

Los desarrolladores pueden ejecutar más tareas de IA con restricciones en la GPU de una sola laptop y ahorrar tiempo y memoria.

## Fuentes y referencias

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Última actualización: 2026-10-08
