Oossa

Tencent, 5B 멀티모달 파싱 모델 Youtu-Parsing-Omni 공개

Hugging Face에 공개된 새 모델은 문서, 이미지, 차트, 오디오, 동영상을 읽고 하나의 JSON 구조로 출력합니다.

짧은 소식작성: Oossa 게시일: 1 분 읽기

Tencent가 Youtu-Parsing-Omni를 Hugging Face에 공개했습니다. 50억 개 파라미터를 갖춘 소형 모델로, 텍스트 페이지나 사진, 차트, 오디오 클립, 동영상 등 단일 입력을 받아 레이아웃, 텍스트, 표, 수식, 타임스탬프, 캡션을 설명하는 구조화된 JSON 형식으로 결과를 반환합니다. 공개 모델 가운데 OmniDocBench 벤치마크에서 Overall 최고 점수를 기록했으며, OmniParsingBench에서는 Gemini-3-Pro에 이어 2위를 차지했습니다. 손쉽게 서빙할 수 있도록 vLLM 플러그인과 추론 예제도 포함돼 있습니다.

왜 중요한가

개발자는 OCR, 오디오, 동영상 모델을 따로 마련하지 않고도 앱에 여러 유형의 문서를 이해하는 기능을 추가할 수 있습니다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.