A Hugging Face anunciou um ranking aberto de modelos de texto para fala (TTS) que avalia modelos de código aberto com métricas automatizadas. O sistema mede a inteligibilidade pela taxa de erro de palavras, a velocidade pelo fator de tempo real e pelo tempo até o primeiro áudio, e a semelhança entre vozes pela similaridade de cosseno dos embeddings. A avaliação de um modelo leva algumas horas, em comparação com as semanas necessárias em competições baseadas em preferência humana. O ranking também permite que os usuários ouçam os resultados e enviem comentários.
Por que importa
A iniciativa oferece aos desenvolvedores uma maneira rápida e reproduzível de comparar modelos de fala de código aberto, ajudando-os a escolher opções mais rápidas ou precisas para seus aplicativos.