Suno a lancé la bêta publique d’une nouvelle fonction Speech. L’outil transforme un script ou une courte description en texte parlé et y ajoute une musique de fond dans le même fichier. Il est disponible sur le site et l’application mobile de Suno. Les utilisateurs peuvent activer ou couper la musique, et choisir entre une simple instruction ou un script complet. La bêta peut générer des extraits d’environ huit minutes au maximum.
Fonctionnement
En mode Simple, il suffit de saisir une description, comme « un capitaine pirate qui galvanise son équipage », pour que l’IA crée une voix et une bande-son assortie. En mode Advanced, on peut coller un script, choisir le genre de la voix, définir le style de diction et régler le degré de variation ajouté par l’IA. La bêta reste expérimentale : Suno indique que les accents britanniques prennent parfois des intonations australiennes et que les pauses peuvent être excessivement dramatiques.
Ce qui change par rapport aux autres outils
Contrairement à la plupart des services de synthèse vocale, le modèle de Suno génère la voix et la musique ensemble, dans une seule piste. Il est possible de couper la musique pour ne garder qu’une voix claire. Suno espère que cette combinaison sera utile, par exemple, pour des lectures poétiques sur fond apaisant ou des voix off énergiques pour des présentations.
Pourquoi c'est important
Pour les créateurs qui utilisent déjà Suno pour la musique, cette nouvelle fonction vocale permet d’ajouter une narration ou des dialogues sans quitter la plateforme. Elle pourrait simplifier la création de courtes publicités audio, de podcasts ou d’enregistrements pédagogiques. Le résultat nécessite toutefois encore des retouches : la bêta prononce parfois mal certains mots ou ajoute des pauses étranges.