Перейти к содержимому

Creé un VIDEO de mí mismo sin grabarlo 😱 | Voz Clonada + Imagen con IA LOCAL

IANext

0:00 / 0:00

Creé un VIDEO de mí mismo sin grabarlo 😱 | Voz Clonada + Imagen con IA LOCAL

258 просмотров · 4 нед. назад
IANext
2,84 тыс. подписчиков
258 просмотров · 4 нед. назад
¿Te imaginas poder crear un video en el que aparezcas hablando sin tener que grabarlo? En este tutorial te muestro cómo crear este tipo de videos utilizando inteligencia artificial directamente en tu propio computador. El flujo es muy interesante: primero clonamos nuestra propia voz para generar un audio completamente nuevo y después utilizamos ese audio junto con una imagen para generar un video en el que la persona de la fotografía parece hablar. Y lo mejor: **todo el proceso se realiza en LOCAL**, utilizando ComfyUI y modelos de inteligencia artificial que podemos ejecutar en nuestro propio PC. 🔥 ¿Qué vas a aprender en este video? Primero veremos cómo funciona el proceso de **clonación de voz**, utilizando una grabación de nuestra propia voz como referencia. A partir de esa grabación podemos generar un nuevo audio manteniendo muchos de los matices de nuestra voz. Después veremos cómo preparar ese audio para utilizarlo en el workflow de generación de video. Finalmente, pasaremos a ComfyUI para utilizar **LTX 2.3 con audio y video**, donde cargaremos nuestra imagen y el audio generado para crear el video final. También veremos: ✅ Qué características debe tener la grabación utilizada para clonar la voz ✅ Cómo generar el audio utilizando nuestra voz clonada ✅ Cómo preparar el archivo de audio para el workflow de video ✅ Cómo cargar nuestra propia imagen en ComfyUI ✅ Cómo cargar el audio de referencia ✅ Cómo configurar el workflow de LTX 2.3 ✅ Qué modelos necesitamos descargar ✅ Dónde colocar los modelos dentro de la instalación portable ✅ Cómo configurar el prompt ✅ Cómo configurar resolución, duración y FPS ✅ Cómo generar el video final ✅ Algunos errores y problemas que pueden aparecer durante el proceso ✅ Diferentes pruebas realizadas con el workflow En mi caso, estoy utilizando un computador con **32 GB de RAM y una NVIDIA RTX 4060 Ti de 16 GB**, y una generación de aproximadamente 15 segundos puede tardar unos minutos dependiendo de la configuración del equipo. ⚠️ IMPORTANTE: la clonación de voz y la generación de video requieren recursos de hardware importantes. El rendimiento dependerá de las características de cada computador. También te recomiendo ver el tutorial específico sobre **clonación de voz**, ya que esa parte del proceso tiene bastante importancia y es un workflow más complejo. ⏱️ CAPÍTULOS 00:00 El video que nunca grabé 00:17 Qué vamos a crear 01:14 Requisitos del computador 02:03 Clonación de voz 03:20 Preparando el audio de referencia 04:27 Generando la voz clonada 05:37 El audio generado 06:18 Preparando el audio para el video 07:00 Pasamos a la generación de video 08:00 LTX 2.3 con imagen y audio 09:09 Otros workflows disponibles 09:39 Solucionando los errores del workflow 10:08 Descargando los modelos necesarios 11:27 Recargando ComfyUI 11:43 Cargando nuestra imagen y audio 12:13 Configuración del prompt 13:01 Configuración importante del workflow 13:36 Resolución, duración y FPS 14:07 Generando nuestro video 14:14 ¿Cuánto tarda en generar? 14:53 Pruebas y errores 15:44 Conclusiones 16:21 Clonación de voz y próximos videos 💻 Todo el proceso mostrado en este video está orientado a trabajar con IA de manera local, utilizando nuestro propio computador. Si te interesa la inteligencia artificial, generación de imágenes, generación de video, clonación de voz, ComfyUI y modelos de IA que podemos ejecutar localmente, **suscríbete a IA Next**. 👍 Si este tutorial te resulta útil, déjame un LIKE y cuéntame en los comentarios qué tipo de workflow de IA local te gustaría que probáramos en el próximo video. #InteligenciaArtificial #ComfyUI #LTX23 #IA #VozClonada #IAEnLocal