HeadlinesBriefing favicon HeadlinesBriefing.com

Gemini 3.8 Flash TTS lance la génération vocale expressive

Hacker News •
×

Google AI présente Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS comme ses modèles de génération audio les plus expressifs à ce jour. Ces modèles permettent aux créateurs de générer des voix de personnages personnalisées et des dialogues de scènes directes dans Google AI Studio, Gemini API et Google Vids. Gemini 3.8 Flash TTS est conçu pour une direction créative profonde, permettant aux utilisateurs de créer des voix entièrement nouvelles à partir de zéro à l'aide de invites en langage naturel.

Les utilisateurs peuvent diriger chaque ligne de performance ligne par ligne avec un contrôle granulaire sur les indices d'acting, le rythme, les changements de dialecte et les répliques de fond. Gemini 3.8 Flash-Lite TTS offre une mise à l'échelle à haut volume et économique pour le doublage et les agents vocaux expressifs avec un contrôle fin sur le ton et le rythme. Les modèles complètent la famille Gemini Audio en pleine croissance de Google et offrent un accès à plus de 2 000 voix prêtes à la production dans plus de 100 langues et dialectes.

Entités clés : entreprises : Google, Google AI ; personnes : Alan Cowen. FAQ : Quelles sont les principales fonctionnalités de Gemini 3.8 Flash TTS ? Gemini 3.8 Flash TTS permet la création de voix sur mesure à partir de zéro à l'aide d'invites en langage naturel, un contrôle granulaire des performances ligne par ligne, un accès à plus de 2 000 voix prêtes à la production dans plus de 100 langues et la réplication vocale à partir d'échantillons audio de 30 secondes avec vérification du consentement. FAQ Q : Quelles sont les principales fonctionnalités de Gemini 3.8 Flash TTS ? FAQ A : Gemini 3.8 Flash TTS permet la création de voix sur mesure à partir de zéro à l'aide d'invites en langage naturel, un contrôle granulaire des performances ligne par ligne, un accès à plus de 2 000 voix prêtes à la production dans plus de 100 langues et la réplication vocale à partir d'échantillons audio de 30 secondes avec vérification du consentement.