Команда под руководством Арипа Асадулаева опубликовала метод, который заставляет языковые модели строго соблюдать заданный формат вывода без дополнительной памяти. Метод преобразует формат в компактный конечный автомат и применяет маску непосредственно на GPU. На Apple M2 Pro с 16 GB модели Qwen‑3.5‑2B и 4B выполняли извлечение данных по заданной схеме примерно в 1,2–1,3 раза быстрее, использовали для грамматики всего 3 MB вместо 1,5 GB, а сервер мог одновременно обслуживать шестнадцать грамматик. Шестнадцать параллельно работающих агентов, вызывающих инструменты, справились с задачами в 2,5 раза быстрее.
Почему это важно
Разработчики смогут выполнять больше задач с ограниченным форматом вывода на GPU одного ноутбука, экономя время и память.