Google a annoncé que son API Gemini proposait désormais deux nouveaux modèles de synthèse vocale (TTS). Gemini‑3.8‑flash‑tts est un modèle vocal de haute qualité, digne d’un studio, qui prend en charge les dialectes régionaux et assure une grande stabilité sur les contenus longs. Gemini‑3.8‑flash‑lite‑tts est un modèle plus rapide et moins coûteux, destiné à remplacer l’ancien flash‑tts‑preview pour les agents vocaux en temps réel.
Pourquoi c'est important
Les développeurs peuvent désormais intégrer à leurs applications une sortie vocale plus naturelle et économique, notamment pour les agents qui doivent converser en temps réel.