# Tencent veröffentlicht Youtu-Parsing-Omni mit 5 Milliarden Parametern

> Das neue Modell auf Hugging Face verarbeitet Dokumente, Bilder, Diagramme, Audio und Video und gibt die Ergebnisse als einheitliche JSON-Struktur aus.

Oossa · 2026-10-09 · https://oossa.com/de/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent hat Youtu-Parsing-Omni auf Hugging Face veröffentlicht. Das kompakte Modell mit 5 Milliarden Parametern kann einzelne Eingaben verarbeiten – etwa eine Textseite, ein Foto, ein Diagramm, einen Audioclip oder ein Video – und als Ergebnis eine strukturierte JSON-Hülle mit Angaben zu Layout, Text, Tabellen, Formeln, Zeitstempeln und Bildunterschriften ausgeben. Unter den offenen Modellen erzielte es im Benchmark OmniDocBench die höchste Gesamtwertung und belegte bei OmniParsingBench den zweiten Platz hinter Gemini‑3‑Pro. Für die einfache Bereitstellung sind ein vLLM-Plugin und Beispiele für die Inferenz enthalten.

## Die Fakten

- 5 Milliarden Parameter
- Im Oktober 2026 auf Hugging Face veröffentlicht

## Warum es wichtig ist

Entwickler können Apps um das Verständnis verschiedener Dokumenttypen erweitern, ohne separate OCR-, Audio- oder Videomodelle zu benötigen.

## Quellen und Referenzen

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
