# Tencent släpper Youtu-Parsing-Omni, en multimodal modell med 5B parametrar

> Den nya modellen på Hugging Face kan läsa dokument, bilder, diagram, ljud och video och sammanställa resultatet i en enda JSON-struktur.

Oossa · 2026-10-09 · https://oossa.com/sv/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent har laddat upp Youtu-Parsing-Omni till Hugging Face. Det är en kompakt modell med 5 miljarder parametrar som kan ta emot en enda indata – till exempel en textsida, ett fotografi, ett diagram, ett ljudklipp eller en video – och returnera ett strukturerat JSON-objekt med uppgifter om layout, text, tabeller, formler, tidsstämplar och bildtexter. Modellen fick högst totalpoäng bland öppna modeller i benchmarktestet OmniDocBench och kom på andra plats efter Gemini‑3‑Pro i OmniParsingBench. En vLLM-plugin och exempel på inferens ingår för enkel driftsättning.

## Fakta

- 5 miljarder parametrar
- Släpptes på Hugging Face i oktober 2026

## Varför det spelar roll

Utvecklare kan lägga till stöd för dokument med flera medietyper i appar utan att behöva separata modeller för OCR, ljud och video.

## Källor och referenser

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Senast uppdaterad: 2026-10-09
