Hugging Face a annoncé le lancement d’un classement des modèles de synthèse vocale (TTS) open source, évalués à l’aide de mesures automatiques. Il mesure l’intelligibilité au moyen du taux d’erreur sur les mots, la vitesse grâce au facteur temps réel et au délai avant le premier son, ainsi que la similarité des voix à partir de la similarité cosinus entre les représentations vectorielles. Le système peut évaluer un modèle en quelques heures, contre plusieurs semaines pour les plateformes fondées sur les préférences humaines. Le classement permet aussi d’écouter les résultats et de donner son avis.
Pourquoi c'est important
Cet outil offre aux développeurs un moyen rapide et reproductible de comparer les modèles vocaux open source et de choisir ceux qui sont plus rapides ou plus précis pour leurs applications.