Tencent, Youtu-Parsing-Omni’yi Hugging Face’e yükledi. 5 milyar parametreli kompakt model; metin sayfası, fotoğraf, grafik, ses kaydı veya video gibi tek bir girdiyi alıp düzeni, metni, tabloları, formülleri, zaman damgalarını ve altyazıları açıklayan yapılandırılmış bir JSON çıktısı oluşturabiliyor. Model, açık modeller arasında OmniDocBench kıyaslamasında en yüksek Genel puanı aldı; OmniParsingBench’te ise yalnızca Gemini‑3‑Pro’nun ardından ikinci sırada yer aldı. Kolayca hizmete alınabilmesi için bir vLLM eklentisi ve çıkarım örnekleri de sunuluyor.
Neden önemli
Geliştiriciler, ayrı OCR, ses veya video modellerine ihtiyaç duymadan uygulamalarına farklı türlerdeki belgeleri anlama özelliği ekleyebilir.