Hugging Face объявила о запуске Open TTS Leaderboard — рейтинга открытых моделей преобразования текста в речь, которые оцениваются автоматически. Разборчивость речи измеряется по частоте ошибок в словах, скорость — по коэффициенту реального времени и времени до первого аудио, а сходство голосов — по косинусному сходству эмбеддингов. Оценка модели занимает несколько часов, тогда как на проверку в рамках голосований с учетом предпочтений людей уходят недели. Пользователи также могут прослушивать результаты и оставлять отзывы.
Почему это важно
Рейтинг позволяет разработчикам быстро и воспроизводимо сравнивать открытые модели синтеза речи и выбирать для приложений более быстрые или точные варианты.