Oossa

Un nuevo método acelera la generación de texto con formato restringido

Un motor de bajo consumo de memoria genera JSON y llamadas a herramientas entre 1,2 y 1,3 veces más rápido y reduce drásticamente el tamaño de las gramáticas.

BrevePor Publicado por Oossa: 1 min de lectura

Un equipo liderado por Arip Asadulaev publicó un método que obliga a los modelos de lenguaje a respetar un formato de salida estricto sin usar memoria adicional. La técnica convierte el formato en un autómata pequeño y aplica la máscara directamente en la GPU. En un Apple M2 Pro de 16 GB, los modelos Qwen‑3.5‑2B y 4B completaron tareas de extracción con esquemas entre 1,2 y 1,3 veces más rápido, usaron solo 3 MB para una gramática en lugar de hasta 1,5 GB y permitieron que un servidor alojara dieciséis gramáticas. Dieciséis agentes paralelos que llamaban a herramientas terminaron sus tareas 2,5 veces antes.

Por qué importa

Los desarrolladores pueden ejecutar más tareas de IA con restricciones en la GPU de una sola laptop y ahorrar tiempo y memoria.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.