Oossa

Новый метод ускоряет генерацию по заданной схеме

Исследователи представили экономичный по памяти движок: он генерирует JSON и вызовы инструментов в 1,2–1,3 раза быстрее и значительно уменьшает размер грамматики.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Команда под руководством Арипа Асадулаева опубликовала метод, который заставляет языковые модели строго соблюдать заданный формат вывода без дополнительной памяти. Метод преобразует формат в компактный конечный автомат и применяет маску непосредственно на GPU. На Apple M2 Pro с 16 GB модели Qwen‑3.5‑2B и 4B выполняли извлечение данных по заданной схеме примерно в 1,2–1,3 раза быстрее, использовали для грамматики всего 3 MB вместо 1,5 GB, а сервер мог одновременно обслуживать шестнадцать грамматик. Шестнадцать параллельно работающих агентов, вызывающих инструменты, справились с задачами в 2,5 раза быстрее.

Почему это важно

Разработчики смогут выполнять больше задач с ограниченным форматом вывода на GPU одного ноутбука, экономя время и память.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.