Oossa

Tencent veröffentlicht Youtu-Parsing-Omni mit 5 Milliarden Parametern

Das neue Modell auf Hugging Face verarbeitet Dokumente, Bilder, Diagramme, Audio und Video und gibt die Ergebnisse als einheitliche JSON-Struktur aus.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Tencent hat Youtu-Parsing-Omni auf Hugging Face veröffentlicht. Das kompakte Modell mit 5 Milliarden Parametern kann einzelne Eingaben verarbeiten – etwa eine Textseite, ein Foto, ein Diagramm, einen Audioclip oder ein Video – und als Ergebnis eine strukturierte JSON-Hülle mit Angaben zu Layout, Text, Tabellen, Formeln, Zeitstempeln und Bildunterschriften ausgeben. Unter den offenen Modellen erzielte es im Benchmark OmniDocBench die höchste Gesamtwertung und belegte bei OmniParsingBench den zweiten Platz hinter Gemini‑3‑Pro. Für die einfache Bereitstellung sind ein vLLM-Plugin und Beispiele für die Inferenz enthalten.

Warum es wichtig ist

Entwickler können Apps um das Verständnis verschiedener Dokumenttypen erweitern, ohne separate OCR-, Audio- oder Videomodelle zu benötigen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.