Gemini 3.8 TTS: Clonación de Voz y Nueva API
Carlos Alarcón - AI
0:00 / 0:00
Gemini 3.8 TTS: Clonación de Voz y Nueva API
8 118 просмотров · 13 дн. назад
Carlos Alarcón - AI
28,2 тыс. подписчиков
8 118 просмотров · 13 дн. назад
Google acaba de lanzar Gemini 3.8 TTS con capacidades revolucionarias de síntesis y clonación de voz. Descubre cómo aprovechar sus nuevos modelos y controlar emociones con la API oficial.
En este video analizamos a fondo Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos nuevos modelos de texto a voz optimizados para producción cinematográfica y aplicaciones en tiempo real de baja latencia. Veremos cómo ha cambiado la sintaxis de inferencia para separar la transcripción de las directrices dramáticas, cómo orquestar diálogos dinámicos entre múltiples personajes y la forma correcta de replicar una voz propia con apenas 30 segundos de referencia.
Temas cubiertos en este tutorial:
• Comparativa técnica: Gemini 3.8 Flash TTS vs. Gemini 3.8 Flash-Lite TTS.
• Nueva arquitectura de la API: separación de texto literal y metadatos de estilo.
• Uso de etiquetas dramáticas integradas (pausas, suspiros, risas y toses).
• Configuración de conversaciones y diálogos multipersona en un solo llamado.
• Creación y diseño de voces inéditas mediante prompts descriptivos.
• Replicación y clonación de voz mediante validación biométrica y marcas de agua SynthID.
• Implementación práctica paso a paso en Python utilizando la librería google-genai.
🔗 Recursos y enlaces mencionados:
• Google AI Studio: https://aistudio.google.com
• Cuaderno de código interactivo (Notebook): https://github.com/alarcon7a/youtube-...
• Documentación de Gemini API de Google: https://aistudio.google.com/learn/gem...
¿Qué opinas del nivel de naturalidad y la consistencia tonal que ofrece Gemini 3.8 TTS? Déjanos tu experiencia y dudas en la sección de comentarios. Si este contenido te aportó valor, dale me gusta al video, compártelo con otros desarrolladores y suscríbete al canal activando la campana de notificaciones para estar al día con las últimas herramientas de inteligencia artificial.
#AI #Gemini #IA
Mi nombre es Carlos Alarcon, experto en AI y ciencia de datos, Google Developer Expert (GDE) en AI/ML, Microsoft Most Valuable Professional (MVP) en AI/ML y reconocido divulgador.
🔔 ¡No olvides suscribirte y activar las notificaciones para estar al día con las últimas investigaciones y descubrimientos en AI!
Twitter: / alarcon7a
LinkedIn: / alarcon7a
Instagram: / alarcon7a
Comunidad en whatsapp: https://chat.whatsapp.com/HSsQiAKCL5x...
Web: https://www.carlosalarcon.ai/
Timestamp:
00:00 Presentando Gemini 3.8 TTS
01:05 Comparando Flash y Flash Lite
05:16 Probando voces en AI Studio
12:40 Conectando la API con código
18:40 Controlando estilos de locución
20:17 Insertando etiquetas narrativas y pausas
22:38 Creando diálogo con múltiples voces
25:40 Diseñando voces desde prompts
31:03 Clonando mi propia voz