Hugging Face anunció un ranking abierto que evalúa modelos de texto a voz de código abierto con métricas automáticas. Mide la inteligibilidad mediante la tasa de error de palabras, la velocidad con el factor de tiempo real y el tiempo hasta el primer audio, y la similitud entre voces mediante la similitud coseno de sus embeddings. El sistema puede evaluar un modelo en unas horas, frente a las semanas que requieren las comparativas basadas en preferencias humanas. El ranking también permite escuchar los resultados y enviar comentarios.
Por qué importa
Ofrece a los desarrolladores una forma rápida y reproducible de comparar modelos de voz de código abierto y les ayuda a elegir opciones más rápidas o precisas para sus aplicaciones.