Oossa

Tencent, 5 milyar parametreli Youtu-Parsing-Omni’yi yayımladı

Hugging Face’teki yeni model; belgeleri, görselleri, grafikleri, ses ve videoları okuyup tek bir JSON yapısı oluşturuyor.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

Tencent, Youtu-Parsing-Omni’yi Hugging Face’e yükledi. 5 milyar parametreli kompakt model; metin sayfası, fotoğraf, grafik, ses kaydı veya video gibi tek bir girdiyi alıp düzeni, metni, tabloları, formülleri, zaman damgalarını ve altyazıları açıklayan yapılandırılmış bir JSON çıktısı oluşturabiliyor. Model, açık modeller arasında OmniDocBench kıyaslamasında en yüksek Genel puanı aldı; OmniParsingBench’te ise yalnızca Gemini‑3‑Pro’nun ardından ikinci sırada yer aldı. Kolayca hizmete alınabilmesi için bir vLLM eklentisi ve çıkarım örnekleri de sunuluyor.

Neden önemli

Geliştiriciler, ayrı OCR, ses veya video modellerine ihtiyaç duymadan uygulamalarına farklı türlerdeki belgeleri anlama özelliği ekleyebilir.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.