Hugging Face heeft de Open TTS Leaderboard aangekondigd, die open-sourcemodellen voor tekst-naar-spraak beoordeelt aan de hand van automatische meetwaarden. De ranglijst meet verstaanbaarheid met de woordfoutfrequentie, snelheid met de real-timefactor en de tijd tot het eerste audiofragment, en gelijkenis tussen sprekers aan de hand van de cosinusgelijkenis van embeddings. Het systeem kan een model binnen enkele uren beoordelen, terwijl arena’s die menselijke voorkeuren meten daar weken voor nodig hebben. Gebruikers kunnen op de ranglijst ook naar de resultaten luisteren en feedback geven.
Waarom het ertoe doet
Ontwikkelaars kunnen open-sourcemodellen voor spraak zo snel en reproduceerbaar vergelijken, zodat ze makkelijker kunnen kiezen voor snellere of nauwkeurigere opties voor hun apps.