Hugging Faceは、自動指標でオープンソースのテキスト読み上げ(TTS)モデルを評価する「Open TTS Leaderboard」を発表した。聞き取りやすさは単語誤り率(WER)、速度はリアルタイム係数と音声出力までの時間、話者の類似度は埋め込みのコサイン類似度で測定する。人間の好みに基づく評価プラットフォームでは数週間かかるところ、このシステムなら数時間でモデルを評価できる。また、ユーザーは生成された音声を聞き、フィードバックを送ることもできる。
なぜ重要か
開発者はオープンソース音声モデルをすばやく再現可能な方法で比較でき、アプリに適した、より高速または高精度なモデルを選びやすくなる。