Oossa

ترنسفورمرز 5.18.0 با مدل تفکیک گویندگان زنده منتشر شد

نسخه جدید Hugging Face مدل Nemotron 3 Diarization را اضافه می‌کند؛ مدلی جریانی که می‌تواند در صدای زنده، حداکثر هشت گوینده را شناسایی کند.

خبر کوتاهOossaمنتشرشده توسط Oossa: 1 دقیقه مطالعه

Hugging Face نسخه Transformers 5.18.0 را منتشر کرد. این به‌روزرسانی مدل Nemotron 3 Diarization را اضافه می‌کند؛ مدلی با وزن‌های باز که می‌تواند در صدای زنده یا آفلاین مشخص کند «چه کسی، چه زمانی صحبت کرده است». این مدل از حداکثر هشت گوینده پشتیبانی می‌کند و به توسعه‌دهندگان امکان می‌دهد تأخیر را از 80 ms تا 30.4 ثانیه انتخاب کنند.

این نسخه همچنین مدل‌های چندوجهی NemotronH Omni و HyperCLOVAX Vision V2 را به‌همراه مجموعه‌ای از رفع اشکال‌ها و بهبودهای عملکردی ارائه می‌کند.

چرا مهم است

توسعه‌دهندگان اکنون می‌توانند قابلیت رونویسی زنده با برچسب گویندگان را به اپلیکیشن‌ها اضافه کنند تا دنبال کردن جلسه‌ها و پادکست‌ها آسان‌تر شود.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.