# Tencent, 5 milyar parametreli Youtu-Parsing-Omni’yi yayımladı

> Hugging Face’teki yeni model; belgeleri, görselleri, grafikleri, ses ve videoları okuyup tek bir JSON yapısı oluşturuyor.

Oossa · 2026-10-09 · https://oossa.com/tr/tencent-releases-youtu-parsing-omni-a-5b-omni-modal-parsing-model

Tencent, Youtu-Parsing-Omni’yi Hugging Face’e yükledi. 5 milyar parametreli kompakt model; metin sayfası, fotoğraf, grafik, ses kaydı veya video gibi tek bir girdiyi alıp düzeni, metni, tabloları, formülleri, zaman damgalarını ve altyazıları açıklayan yapılandırılmış bir JSON çıktısı oluşturabiliyor. Model, açık modeller arasında OmniDocBench kıyaslamasında en yüksek Genel puanı aldı; OmniParsingBench’te ise yalnızca Gemini‑3‑Pro’nun ardından ikinci sırada yer aldı. Kolayca hizmete alınabilmesi için bir vLLM eklentisi ve çıkarım örnekleri de sunuluyor.

## Gerçekler

- 5 milyar parametre
- Ekim 2026’da Hugging Face’te yayımlandı

## Neden önemli

Geliştiriciler, ayrı OCR, ses veya video modellerine ihtiyaç duymadan uygulamalarına farklı türlerdeki belgeleri anlama özelliği ekleyebilir.

## Kaynaklar ve referanslar

1. [New model on Hugging Face: tencent/Youtu-Parsing-Omni (image-text-to-text)](https://huggingface.co/tencent/Youtu-Parsing-Omni) – Tencent Hunyuan, 2026-10-09

Son güncelleme: 2026-10-09
