Hugging Face har presenterat Open TTS Leaderboard, som betygsätter text-till-tal-modeller med öppen källkod med hjälp av automatiska mått. Begripligheten mäts med ord-felfrekvens, hastigheten med realtidsfaktor och tiden till det första ljudet, och likheten mellan talare med cosinuslikhet mellan embeddingar. Systemet kan utvärdera en modell på några timmar, jämfört med de veckor som krävs för arenor där människor bedömer och rangordnar modeller. På topplistan kan användare också lyssna på resultaten och lämna feedback.
Varför det spelar roll
Det ger utvecklare ett snabbt och reproducerbart sätt att jämföra talmodeller med öppen källkod, så att de lättare kan välja snabbare eller mer träffsäkra alternativ för sina appar.