Hugging Face ने Open TTS Leaderboard की घोषणा की है, जो स्वचालित मानकों के आधार पर ओपन-सोर्स टेक्स्ट-टू-स्पीच मॉडल को रेटिंग देती है। यह शब्द त्रुटि दर से स्पष्टता, रियल-टाइम फैक्टर और पहली ऑडियो मिलने में लगने वाले समय से गति, और एम्बेडिंग की कोसाइन समानता से वक्ता की आवाज़ से मेल को मापती है। इस सिस्टम से किसी मॉडल का मूल्यांकन कुछ घंटों में किया जा सकता है, जबकि मानवीय पसंद पर आधारित एरेना में इसमें कई हफ्ते लगते हैं। लीडरबोर्ड पर उपयोगकर्ता आउटपुट सुनकर प्रतिक्रिया भी दे सकते हैं।
यह क्यों मायने रखता है
यह डेवलपरों को ओपन-सोर्स स्पीच मॉडल की तेज़ी से और दोहराए जा सकने वाले तरीके से तुलना करने का साधन देता है, जिससे वे ऐप्स के लिए तेज़ या अधिक सटीक विकल्प चुन सकते हैं।