Gemini 3.8 Flash TTS : pas de clonage vocal dans AI Studio en France

Par: Michael Korgs | aujourd'hui, 00:23
Annonce officielle des modèles Gemini 3.8 Flash TTS et Flash-Lite TTS Annonce officielle des modèles Gemini 3.8 Flash TTS et Flash-Lite TTS. Source: blog.google

Google a lancé deux nouveaux modèles de synthèse vocale, Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, qui remplacent les voix figées de l'ancienne génération par un studio de création vocale à la demande. Gemini 3.8 Flash TTS alimente déjà Gemini Notebook, tandis que Flash-Lite TTS équipe Google Vids.

Gemini 3.8 Flash TTS vise le travail créatif : concevoir une voix inédite à partir d'une simple description en langage naturel, avec un contrôle fin du rythme, du ton et même du changement d'accent en cours de lecture. Google la destine aux jeux vidéo, aux livres audio et aux podcasts, avec des indications scéniques — rires, soupirs — insérées directement dans le texte lu. Flash-Lite TTS, plus légère, cible plutôt les usages massifs et économiques : doublage de gros volumes de contenu ou agents vocaux conversationnels.

La bibliothèque de voix passe de 30 voix originales à une bibliothèque quasi illimitée, avec accès à plus de 2000 voix prêtes à l'emploi, incluant des variantes régionales comme le français québécois ou l'anglais écossais. La création de voix par simple description textuelle couvre plus de 100 langues et dialectes.

Le clonage vocal fermé dans AI Studio en France

Les deux modèles permettent aussi de cloner une voix à partir d'un échantillon audio de 30 secondes, moyennant une vérification du consentement de la personne concernée. Chaque extrait généré porte un filigrane SynthID invisible ainsi que des identifiants C2PA. Mais cette fonction n'est pas accessible via Google AI Studio dans l'Espace économique européen, dont fait partie la France, ni au Royaume-Uni, en Suisse, en Inde ou dans les États américains de l'Illinois et du Texas. Dans AI Studio, les développeurs français gardent donc accès à la création de voix originales et à la bibliothèque de plus de 2000 voix, mais pas au clonage à partir d'un enregistrement existant.

Sur le benchmark de conception vocale de Hume AI, Gemini 3.8 Flash TTS obtient 71,4 points et prend la première place. Sur la modélisation des accents, elle atteint 60,8 points, également en tête. Les deux modèles se classent premier et deuxième de l'indice de qualité générale de Hume AI, et arrivent en tête des préférences humaines du Voice Arena pour plusieurs langues, dont le japonais, l'arabe et l'espagnol mexicain.

Les deux modèles sont dès maintenant accessibles via l'API Gemini et Google AI Studio ; l'accès via Gemini Enterprise doit suivre prochainement. Une fonction de « mixage vocal », qui permettra d'ajuster le timbre et l'accent d'une voix de la bibliothèque par simple instruction, doit arriver plus tard.