KitanaFotos y videos con IA
Creador de videos · 4 min de lectura

Convertir una foto en vídeo con IA: cómo funciona la tecnología

Qué pasa cuando una imagen fija se convierte en un clip: cómo predice el movimiento el modelo, por qué unas fotos se animan bien y otras se deforman, y cuáles son hoy los límites reales.

Por el equipo de Kitana
CUCREADOR DE VIDEOS

Convertir una foto en vídeo con IA parece simplemente que la foto empieza a moverse. Lo que ocurre en realidad es más extraño y merece la pena entenderlo, porque explica exactamente qué fotos funcionan y cuáles producen la deformación que todos hemos visto.

Qué está prediciendo el modelo

Dale una imagen fija y la tratará como el primer fotograma de un clip que no existe. Su trabajo es generar los fotogramas que vienen después.

Lo hace porque ha aprendido, a partir de una cantidad enorme de vídeo, lo que suele pasar a continuación. No en una escena concreta, porque nunca ha visto tu salón, sino en general. El pelo en aire quieto se mece un poco. La tela se asienta. Una persona de pie no se queda totalmente rígida. La luz que entra por una ventana cambia.

Dos restricciones gobiernan el resultado, y tiran en direcciones opuestas:

Coherencia temporal. Cada fotograma tiene que ser coherente con los anteriores. La cara del fotograma 60 tiene que ser la misma que la del fotograma 1.

Movimiento plausible. Algo tiene que moverse de verdad, o habrás producido una imagen fija repetida 24 veces por segundo.

Casi todos los fallos son una de estas dos restricciones perdiendo contra la otra. Demasiado peso al movimiento y la identidad deriva: ahí está la deformación. Demasiado a la coherencia y obtienes una imagen que apenas se mueve.

Por qué unas fotos se animan bien

El patrón es constante, y depende de cuánto tiene que inventar el modelo.

Se anima bien:

  • Un sujeto claro, grande en el encuadre y bien enfocado
  • Profundidad detrás del sujeto, con un fondo separado de él
  • De frente o ligeramente girado, no de perfil
  • Luz uniforme con una dirección visible
  • Espacio alrededor del sujeto para que la cámara se mueva

Se anima mal:

  • Sujetos pequeños o lejanos, con demasiada poca estructura facial para mantenerla coherente
  • Escenas cargadas y desordenadas, con muchas cosas cuyo movimiento el modelo tiene que decidir
  • Manos en primer plano, todavía el punto más débil de todos estos modelos
  • Texto o logotipos, que se emborronan en cuanto algo se mueve
  • Encuadres muy cerrados sin espacio para el movimiento de cámara
  • Varias personas, donde las identidades pueden intercambiarse

El hilo común: cuanto más tiene que inventar el modelo, más deriva. Un sujeto nítido, sencillo y bien separado deja poco que inventar.

Por qué los clips son cortos

Cuatro segundos parece arbitrario. No lo es.

El coste crece con los fotogramas, y los fotogramas de vídeo son caros: aproximadamente un orden de magnitud más de cómputo por segundo que una imagen fija. Pero el límite más duro es la coherencia. La deriva de identidad se acumula: una cara que está bien al 99 % en el primer segundo se nota rara en el octavo, porque cada fotograma se genera a partir del anterior y los pequeños errores se suman.

Cuatro segundos en vertical es más o menos donde las herramientas de consumo actuales se mantienen coherentes de forma fiable. Y no por casualidad, es también la duración que se repite en bucle con naturalidad en las plataformas de vídeo corto.

Qué foto darle para convertirla en vídeo

La versión práctica:

  1. Una foto nítida. Si entra blanda, sale blanda y temblando.
  2. Un sujeto claro y grande en el encuadre. Cabeza y hombros o medio cuerpo, no una figura lejana.
  3. Separación del fondo. Uno o dos metros de espacio detrás del sujeto.
  4. Espacio en el encuadre. Si quieres un acercamiento, deja sitio hacia donde acercarte.
  5. Una descripción de movimiento sencilla. "Un acercamiento lento." "El pelo moviéndose suavemente." "La luz recorriendo la cara." Una idea, no tres.

Si tu original es blando o pequeño, mejora la calidad de la foto primero como paso aparte. El modelo de vídeo no tiene nada que enfocar: solo puede propagar lo que ya está ahí, incluida la falta de nitidez. Y si es una foto antigua de familia, empieza por restaurarla antes de animarla.

Lo que todavía no puede hacer

Conviene decirlo claramente:

  • Manos. Poco fiables en movimiento en todas las herramientas actuales.
  • Texto. Se emborrona de inmediato.
  • Interacciones complejas. Dos personas haciendo algo juntas, un objeto que alguien recoge. El modelo no entiende la causalidad.
  • Coreografías concretas. Puedes dirigirlo; no puedes escribirle un guion.
  • Duración. Todo lo que pase de unos pocos segundos deriva.

Nada de esto es un problema de ajustes. Son propiedades de cómo funcionan los modelos, y cambiarán con el tiempo, pero no porque tú lo intentes con más ganas hoy.

Dónde es realmente útil

Clips verticales cortos para redes, donde cuatro segundos es el formato nativo y no una concesión. Dar vida a un retrato fijo. Añadir algo de movimiento a una foto de producto estática. Convertir una foto de archivo en algo que retiene la atención un momento más de lo que lo haría una imagen quieta.

Foto a vídeo funciona en las apps de Kitana y no en el estudio del navegador, como parte de Kitana Pro: diez clips al mes de cuatro segundos a 768 por 1344. En la página del creador de vídeo tienes los detalles.

Preguntas frecuentes

¿Sabe el modelo qué pasa a continuación en mi foto?
No. Predice un movimiento coherente con lo que muestra la imagen, a partir de haber visto cantidades enormes de vídeo. Una foto de alguien a mitad de zancada produce un paso porque eso es lo que suele venir después de ese tipo de imágenes, no porque el modelo sepa adónde fue esa persona.
¿Por qué a veces las caras se deforman durante el clip?
Porque el modelo tiene que mantener la cara coherente en cada fotograma mientras la mueve, y la identidad es frágil en movimiento. La deformación es más frecuente cuando la cara es pequeña en el encuadre, está girada o parcialmente tapada. Un sujeto grande, nítido y de frente se deforma mucho menos.
¿Por qué los vídeos con IA son tan cortos?
Por coste y por coherencia, y ambos escalan mal. Cada fotograma extra es cómputo, y cada segundo extra es otra oportunidad para que el sujeto se aleje de cómo era al principio. Cuatro segundos es más o menos donde las herramientas de consumo actuales se mantienen fiables.
¿También se genera el audio?
En la mayoría de herramientas de foto a vídeo, no: el resultado es mudo. Encaja con las plataformas de vídeo corto, donde la mayoría de los clips se ven con el audio propio de la plataforma encima.
¿Qué resolución tiene el resultado?
Kitana produce clips verticales de 768 por 1344 y cuatro segundos, como parte de Kitana Pro. Verticales porque es el formato que las plataformas de vídeo corto muestran sin bandas negras.
¿Puedo controlar el movimiento o es aleatorio?
Puedes guiarlo con una descripción, como un acercamiento lento, el pelo moviéndose o la luz cambiando, y el modelo en general la sigue. Lo que no puedes es especificarlo con precisión fotograma a fotograma. Trata la indicación como una dirección, no como una orden.

¿Listo para ponerlo en práctica?

Crea con Kitana usando la herramienta que encaja con esta guía.

Convierte una foto en vídeo

¿Listo para probarlo tú mismo?

Descarga Kitana y crea tu primera foto con IA en menos de un minuto.