Hugging Face hat eine Open-TTS-Rangliste vorgestellt, die Open-Source-Text-to-Speech-Modelle anhand automatischer Kennzahlen bewertet. Sie misst die Verständlichkeit anhand der Wortfehlerrate, die Geschwindigkeit anhand des Echtzeitfaktors und der Zeit bis zur ersten Audioausgabe sowie die Ähnlichkeit der Sprecher anhand der Kosinusähnlichkeit von Embeddings. Ein Modell lässt sich damit innerhalb weniger Stunden bewerten – bei Arenen, die auf menschlichen Präferenzen beruhen, dauert es Wochen. Außerdem können Nutzerinnen und Nutzer die Ausgaben anhören und Feedback geben.
Warum es wichtig ist
Die Rangliste bietet Entwicklerinnen und Entwicklern eine schnelle, reproduzierbare Möglichkeit, Open-Source-Sprachmodelle zu vergleichen. So können sie für ihre Anwendungen gezieltere Entscheidungen treffen und etwa schnellere oder genauere Modelle auswählen.