# 새 추론 방식, 형식 제약 언어 모델 출력 속도 높여

> 연구진은 JSON 및 도구 호출 생성을 1.2–1.3배 빠르게 하고 문법 크기를 크게 줄이는 저메모리 엔진을 선보였다.

Oossa · 2026-10-08 · https://oossa.com/ko/new-inference-method-speeds-up-schema-constrained-language-model-output

Arip Asadulaev이 이끄는 연구팀은 추가 메모리 없이 언어 모델이 엄격한 출력 형식을 따르도록 하는 방법을 발표했다. 출력 형식을 작은 오토마톤으로 바꾸고, 마스크를 GPU에서 직접 실행하는 방식이다. 16 GB 메모리를 탑재한 Apple M2 Pro에서 Qwen‑3.5‑2B 및 4B 모델은 스키마 제약 추출을 약 1.2–1.3배 빠르게 마쳤다. 문법 저장 공간은 최대 1.5 GB에서 3 MB로 줄었고, 서버 한 대에서 문법 16개를 호스팅할 수 있었다. 도구를 호출하는 에이전트 16개를 병렬로 실행했을 때 작업 완료 시간은 2.5배 단축됐다.

## 팩트

- 발표일: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- 속도 향상: 추출은 1.2–1.3배, 도구 에이전트는 2.5배 빨라짐; 문법 크기는 3 MB로, 기존 1.5 GB에서 감소

## 왜 중요한가

개발자는 노트북 GPU 한 대로 더 많은 형식 제약 AI 작업을 실행해 시간과 메모리를 아낄 수 있다.

## 출처 및 참고 자료

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

최종 업데이트: 2026-10-08
