Oossa

새 추론 방식, 형식 제약 언어 모델 출력 속도 높여

연구진은 JSON 및 도구 호출 생성을 1.2–1.3배 빠르게 하고 문법 크기를 크게 줄이는 저메모리 엔진을 선보였다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Arip Asadulaev이 이끄는 연구팀은 추가 메모리 없이 언어 모델이 엄격한 출력 형식을 따르도록 하는 방법을 발표했다. 출력 형식을 작은 오토마톤으로 바꾸고, 마스크를 GPU에서 직접 실행하는 방식이다. 16 GB 메모리를 탑재한 Apple M2 Pro에서 Qwen‑3.5‑2B 및 4B 모델은 스키마 제약 추출을 약 1.2–1.3배 빠르게 마쳤다. 문법 저장 공간은 최대 1.5 GB에서 3 MB로 줄었고, 서버 한 대에서 문법 16개를 호스팅할 수 있었다. 도구를 호출하는 에이전트 16개를 병렬로 실행했을 때 작업 완료 시간은 2.5배 단축됐다.

왜 중요한가

개발자는 노트북 GPU 한 대로 더 많은 형식 제약 AI 작업을 실행해 시간과 메모리를 아낄 수 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.