Creé un VIDEO de mí mismo sin grabarlo 😱 | Voz Clonada + Imagen con IA LOCAL
IANext
0:00 / 0:00
Creé un VIDEO de mí mismo sin grabarlo 😱 | Voz Clonada + Imagen con IA LOCAL
258 просмотров · 4 нед. назад
IANext
2,84 тыс. подписчиков
258 просмотров · 4 нед. назад
¿Te imaginas poder crear un video en el que aparezcas hablando sin tener que grabarlo?
En este tutorial te muestro cómo crear este tipo de videos utilizando inteligencia artificial directamente en tu propio computador. El flujo es muy interesante: primero clonamos nuestra propia voz para generar un audio completamente nuevo y después utilizamos ese audio junto con una imagen para generar un video en el que la persona de la fotografía parece hablar.
Y lo mejor: **todo el proceso se realiza en LOCAL**, utilizando ComfyUI y modelos de inteligencia artificial que podemos ejecutar en nuestro propio PC.
🔥 ¿Qué vas a aprender en este video?
Primero veremos cómo funciona el proceso de **clonación de voz**, utilizando una grabación de nuestra propia voz como referencia. A partir de esa grabación podemos generar un nuevo audio manteniendo muchos de los matices de nuestra voz.
Después veremos cómo preparar ese audio para utilizarlo en el workflow de generación de video.
Finalmente, pasaremos a ComfyUI para utilizar **LTX 2.3 con audio y video**, donde cargaremos nuestra imagen y el audio generado para crear el video final.
También veremos:
✅ Qué características debe tener la grabación utilizada para clonar la voz
✅ Cómo generar el audio utilizando nuestra voz clonada
✅ Cómo preparar el archivo de audio para el workflow de video
✅ Cómo cargar nuestra propia imagen en ComfyUI
✅ Cómo cargar el audio de referencia
✅ Cómo configurar el workflow de LTX 2.3
✅ Qué modelos necesitamos descargar
✅ Dónde colocar los modelos dentro de la instalación portable
✅ Cómo configurar el prompt
✅ Cómo configurar resolución, duración y FPS
✅ Cómo generar el video final
✅ Algunos errores y problemas que pueden aparecer durante el proceso
✅ Diferentes pruebas realizadas con el workflow
En mi caso, estoy utilizando un computador con **32 GB de RAM y una NVIDIA RTX 4060 Ti de 16 GB**, y una generación de aproximadamente 15 segundos puede tardar unos minutos dependiendo de la configuración del equipo.
⚠️ IMPORTANTE: la clonación de voz y la generación de video requieren recursos de hardware importantes. El rendimiento dependerá de las características de cada computador.
También te recomiendo ver el tutorial específico sobre **clonación de voz**, ya que esa parte del proceso tiene bastante importancia y es un workflow más complejo.
⏱️ CAPÍTULOS
00:00 El video que nunca grabé
00:17 Qué vamos a crear
01:14 Requisitos del computador
02:03 Clonación de voz
03:20 Preparando el audio de referencia
04:27 Generando la voz clonada
05:37 El audio generado
06:18 Preparando el audio para el video
07:00 Pasamos a la generación de video
08:00 LTX 2.3 con imagen y audio
09:09 Otros workflows disponibles
09:39 Solucionando los errores del workflow
10:08 Descargando los modelos necesarios
11:27 Recargando ComfyUI
11:43 Cargando nuestra imagen y audio
12:13 Configuración del prompt
13:01 Configuración importante del workflow
13:36 Resolución, duración y FPS
14:07 Generando nuestro video
14:14 ¿Cuánto tarda en generar?
14:53 Pruebas y errores
15:44 Conclusiones
16:21 Clonación de voz y próximos videos
💻 Todo el proceso mostrado en este video está orientado a trabajar con IA de manera local, utilizando nuestro propio computador.
Si te interesa la inteligencia artificial, generación de imágenes, generación de video, clonación de voz, ComfyUI y modelos de IA que podemos ejecutar localmente, **suscríbete a IA Next**.
👍 Si este tutorial te resulta útil, déjame un LIKE y cuéntame en los comentarios qué tipo de workflow de IA local te gustaría que probáramos en el próximo video.
#InteligenciaArtificial #ComfyUI #LTX23 #IA #VozClonada #IAEnLocal