Tencent가 Youtu-Parsing-Omni를 Hugging Face에 공개했습니다. 50억 개 파라미터를 갖춘 소형 모델로, 텍스트 페이지나 사진, 차트, 오디오 클립, 동영상 등 단일 입력을 받아 레이아웃, 텍스트, 표, 수식, 타임스탬프, 캡션을 설명하는 구조화된 JSON 형식으로 결과를 반환합니다. 공개 모델 가운데 OmniDocBench 벤치마크에서 Overall 최고 점수를 기록했으며, OmniParsingBench에서는 Gemini-3-Pro에 이어 2위를 차지했습니다. 손쉽게 서빙할 수 있도록 vLLM 플러그인과 추론 예제도 포함돼 있습니다.
왜 중요한가
개발자는 OCR, 오디오, 동영상 모델을 따로 마련하지 않고도 앱에 여러 유형의 문서를 이해하는 기능을 추가할 수 있습니다.