Hugging Face ha annunciato la Open TTS Leaderboard, che valuta i modelli open source di sintesi vocale tramite metriche automatiche. Misura l’intelligibilità attraverso il tasso di errore delle parole (WER), la velocità con il fattore in tempo reale e il tempo necessario per generare il primo audio, e la somiglianza tra voci usando la similarità coseno degli embedding. Il sistema può valutare un modello in poche ore, invece delle settimane richieste dai test basati sulle preferenze umane. La classifica permette inoltre di ascoltare i risultati e inviare feedback.
Perché conta
Offre agli sviluppatori un modo rapido e riproducibile per confrontare i modelli vocali open source, aiutandoli a scegliere quelli più veloci o più precisi per le loro app.