# Новый метод ускоряет генерацию по заданной схеме

> Исследователи представили экономичный по памяти движок: он генерирует JSON и вызовы инструментов в 1,2–1,3 раза быстрее и значительно уменьшает размер грамматики.

Oossa · 2026-10-08 · https://oossa.com/ru/new-inference-method-speeds-up-schema-constrained-language-model-output

Команда под руководством Арипа Асадулаева опубликовала метод, который заставляет языковые модели строго соблюдать заданный формат вывода без дополнительной памяти. Метод преобразует формат в компактный конечный автомат и применяет маску непосредственно на GPU. На Apple M2 Pro с 16 GB модели Qwen‑3.5‑2B и 4B выполняли извлечение данных по заданной схеме примерно в 1,2–1,3 раза быстрее, использовали для грамматики всего 3 MB вместо 1,5 GB, а сервер мог одновременно обслуживать шестнадцать грамматик. Шестнадцать параллельно работающих агентов, вызывающих инструменты, справились с задачами в 2,5 раза быстрее.

## Факты

- Опубликовано: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- Ускорение: извлечение данных — в 1,2–1,3 раза; агенты, вызывающие инструменты, — в 2,5 раза; размер грамматики — 3 MB вместо 1,5 GB

## Почему это важно

Разработчики смогут выполнять больше задач с ограниченным форматом вывода на GPU одного ноутбука, экономя время и память.

## Источники и ссылки

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Обновлено: 2026-10-08
