8 mundos sin perder la identidad: prueba de estrés de coherencia de personajes en video con IA
Descubre cómo un personaje con IA mantiene su identidad en 8 mundos en una prueba con Seedance 2: ropa, movimiento y cámara con prompts y fotogramas reales.
Prueba de coherencia entre mundos — Muestra final editada
Muestra final editada · 8 s · Muestra editada sin audio. El artículo distingue las decisiones de generación del ritmo de postproducción.
- 0:00La corredora establece el ancla de identidad
- 0:02El salar, la tormenta y el fuego sustituyen el entorno
- 0:04Los espacios orbital y submarino ponen a prueba la misma acción
- 0:07El cierre revela qué anclas lograron sobrevivir
Queríamos comprobar qué significa en la práctica «mantener el mismo personaje» cuando el fondo cambia ocho veces consecutivas. Un rostro parecido no basta si el abrigo cambia de longitud, la corredora da media vuelta en dirección contraria o la cámara deja de seguirla desde el lateral.
La prueba partió de una única imagen ancla y una generación de 15 segundos con Seedance 2.0. No realizamos ningún reintento. Aunque el material original se editó con posterioridad para la muestra que encabeza este artículo, cada observación de este informe proviene de la toma en bruto sin editar.
Esto es una prueba de estrés, no un benchmark comparativo de modelos. Muestra qué elementos sobrevivieron a un prompt sumamente exigente y qué fallos quedaron expuestos. Otra ejecución podría distribuir los errores de manera diferente.
Configuración de la prueba y criterios de evaluación
El sujeto elegido fue una mujer negra de estética andrógina, con cabello plateado muy corto, un abrigo largo carmesí, ropa negra mate y botas negras. Corría de izquierda a derecha en estricto perfil lateral.

Evaluamos cuatro anclas de coherencia:
- Identidad: evaluó el rostro, cabello, edad y complexión corporal.
- Vestuario: evaluó el abrigo carmesí, la ropa negra y las botas.
- Coherencia espacial: evaluó la posición en pantalla, la escala y la dirección del movimiento.
- Movimiento: evaluó la fase de la zancada y la velocidad de seguimiento de cámara.
Los entornos podían cambiar libremente; esas cuatro áreas eran los componentes que nos propusimos mantener inalterados.
El perfil lateral facilitó juzgar la dirección. También dejó al descubierto la fase de las piernas, la inclinación corporal y la física del abrigo. Una corredora de frente podría dar la sensación de correr en el sitio sin evidenciar los fallos con tanta claridad. El estudio negro eliminó cualquier ambigüedad de fondo, mientras que la diagonal blanca de luz y el abrigo carmesí ofrecieron marcas de seguimiento visual contundentes.
El prompt para generar la imagen fue:
Premium cinematic editorial still of one androgynous Black woman with close-cropped silver hair in stable full-body side profile, sprinting left to right across a pure black studio crossed by one hard white light slash. She wears a long crimson coat over a matte black fitted outfit and black boots. One foot airborne, coat trailing behind, face clearly visible, fierce focused expression. Eye-level 35mm side view, centered subject, clean silhouette, realistic anatomy and fabric motion. No words, letters, numbers, logo, watermark, interface, border or duplicate person.
Traducción y desglose del prompt de imagen: Fotografía editorial cinematográfica de alta costura de una mujer negra de estética andrógina con cabello plateado muy corto en plano de cuerpo entero y riguroso perfil lateral estable, esprintando de izquierda a derecha en un estudio negro puro cruzado por un haz de luz blanca dura. Viste un abrigo largo carmesí sobre un conjunto entallado negro mate y botas negras. Un pie suspendido en el aire, el abrigo ondeando detrás, rostro claramente visible con expresión feroz y concentrada. Plano lateral a la altura de los ojos en lente de 35 mm, sujeto centrado, silueta nítida, anatomía realista y movimiento creíble de la tela. Sin palabras, letras, números, logotipos, marcas de agua, interfaces, bordes ni personas duplicadas.
El prompt de transición entre mundos
El prompt de video reitera las anclas tras describir los ocho mundos:
Use supplied image as strict identity/action anchor. A relentless side-tracking fashion trailer: same runner moves left to right while hard match cuts strike every 0.8-1.2 seconds on footfalls, coat occlusions and whip-pans. Worlds: black studio, mirrored rain tunnel, sun-blasted salt flat, burning baroque opera hall, zero-gravity orbital corridor, underwater cathedral, violent snowstorm brutalist city, final crimson void. No dissolves, no slow morphs, no shot held longer than 1.2 seconds. Lock face, body, crimson coat, screen position, scale, running phase, direction, camera height, 35mm lens and tracking speed. Secondary rain, ash, bubbles and snow react physically. End on a sharp hero stride. No text/signage/logos, face drift, duplicates, extra limbs, flicker or camera jumps.
Estructura y reglas de corte:
- Ancla de referencia: usa la imagen suministrada como ancla estricta de identidad y acción.
- Formato y ritmo: tráiler de moda con travelling lateral incesante; la misma corredora se desplaza de izquierda a derecha con cortes secos por emparejamiento de acción (match cuts) cada 0.8 a 1.2 segundos al compás de las pisadas, oclusiones del abrigo y barridos rápidos de cámara.
- Ocho escenarios: estudio negro → túnel de lluvia con espejos → salar abrasado por el sol → ópera barroca en llamas → pasillo orbital en gravedad cero → catedral submarina → ciudad brutalista bajo fuerte ventisca de nieve → vacío carmesí final.
- Bloqueos innegociables: sin disolvencias ni transformaciones lentas; ningún plano supera 1.2 segundos. Bloquear rostro, cuerpo, abrigo carmesí, posición en pantalla, escala, fase de carrera, dirección, altura de cámara, lente de 35 mm y velocidad de seguimiento. Reacciones físicas realistas de lluvia, ceniza, burbujas y nieve. Cierre con una zancada heroica enérgica. Sin textos, logotipos, deriva facial, duplicados, extremidades adicionales, parpadeos ni saltos de cámara.
El prompt altera el entorno mientras reitera una sola acción continuada. Las pisadas, las oclusiones del abrigo y los barridos de cámara ofrecen puntos naturales para el cambio de escenario. No pedimos al modelo que inventara un relato entre las locaciones.
La dirección fue más estable que la anatomía
La corredora se mantuvo en avance de izquierda a derecha durante todo el metraje original. Jamás invirtió el sentido, no giró hacia la cámara ni se detuvo para posar. En el salar, el entorno pálido eliminó gran parte del contraste original, pero el abrigo y la ropa oscura continuaron despegándose del suelo con nitidez.

La forma de las piernas y la fase de la zancada fueron menos consistentes. La amplitud del paso varió entre mundos y algunos fotogramas comprimieron ligeramente la longitud de las extremidades inferiores. En esta generación, la intención global de «seguir corriendo» sobrevivió con mayor solidez que la fase exacta del ciclo de carrera. Haría falta una prueba de seguimiento controlada para determinar hasta qué punto esta diferencia es sistemática.
El abrigo aportó más identidad que el rostro
La escena de la ópera en llamas modificó la temperatura de color, la arquitectura, los reflejos del suelo y las partículas suspendidas. Sin embargo, el abrigo carmesí siguió reconociéndose al instante.

Esto no establece la regla universal de que el vestuario importe más que los rasgos faciales. La corredora apareció con frecuencia en planos medios o de cuerpo entero, donde el color del abrigo resultaba mucho más fácil de percibir que los detalles del rostro. Con ese encuadre, una camiseta neutra y un peinado convencional habrían dificultado enormemente evaluar la continuidad del personaje.
Definir dos o tres rasgos distintivos de alto contraste basta para una prueba operativa: un color de abrigo, un peinado, un accesorio, una silueta o un movimiento característico repetido. Los mejores identificadores dependen de la escala del plano.
La geometría de cámara se desvió dentro de la misma dirección
En el pasillo orbital, la corredora continuó desplazándose de izquierda a derecha, pero las líneas de fuga en perspectiva y el planeta visible a través de la cristalera hicieron que el decorado pareciera mucho más angular que la toma original de estudio en 35 mm.

La dirección, la posición y la distancia focal de la cámara exigen auditorías independientes. El personaje puede desplazarse en el mismo sentido ocupando una franja distinta del encuadre. Asimismo, la perspectiva y el campo de visión pueden cambiar sin que la acción se invierta. Eso fue lo que ocurrió en esta escena: la dirección se mantuvo fija, mientras que el emplazamiento y la distancia focal aparente sufrieron variaciones.
El mundo submarino reveló un conflicto de física
La catedral submarina introdujo flotabilidad, cáusticas de luz reflejada, burbujas ascendentes, medusas y un medio acuático donde correr con zancadas terrestres desafía las leyes de la física.

El modelo optó por preservar la figura gráfica de la carrera en lugar de adaptar la acción al nado. La imagen funciona dentro de la lógica de un tráiler de moda surrealista, pero resultaría insostenible en una escena narrativa realista.
Cualquier producción debe decidir qué priorizar cuando la acción de partida colisiona con el nuevo entorno:
- conservar la acción original y asumir una física surrealista;
- adaptar la acción y aceptar una transformación evidente del movimiento;
- o concebir un movimiento puente compatible con ambos espacios (un salto en el aire, por ejemplo, puede prolongarse de manera natural como flotación en gravedad cero o suspensión subacuática mucho mejor que una zancada de carrera).
Qué reveló la auditoría densa fotograma a fotograma
Muestreamos la toma original sin cortes cada 0.25 segundos. La velocidad normal de reproducción ocultaba varios desajustes breves.

El rostro se mantuvo reconocible a grandes rasgos, pero se suavizó en los planos donde el personaje ocupaba menor tamaño en pantalla. El tono carmesí del abrigo resistió mucho mejor que su caída y el dibujo de los pliegues. La dirección horizontal fue intachable, aunque la escala y la altura vertical sufrieron oscilaciones leves. La carrera continuó sin pausas, si bien el paso se reinició cerca de varios cambios de plano. La cámara se mantuvo mayormente en seguimiento lateral, con ligeras alteraciones en la distancia focal aparente y el paralaje de fondo.
Los ocho escenarios solicitados aparecieron en pantalla, aunque algunos se prolongaron más allá del rango de 0.8 a 1.2 segundos estipulado. No calificaríamos el resultado como una coherencia de personaje perfecta; demuestra que un conjunto limitado de anclas visuales explícitas puede persistir a través de transformaciones radicales de entorno.
Convierte «mismo personaje» en restricciones visibles
La expresión «mantén el mismo personaje» encierra en realidad múltiples órdenes independientes. Una formulación mucho más verificable define con precisión qué elementos debe poder comparar el espectador:
Use the supplied image as the exact identity and action reference. Preserve face, hairstyle, body proportions, signature wardrobe, prop, movement direction, subject scale, screen position, camera height, focal length, and action phase. Only change the environment, weather, secondary particles, and environment lighting. At every transition, the character must continue the same action without posing, reversing direction, changing clothes, duplicating, or resetting the gait.
Estructura de la plantilla para nuevos casos:
Usa la imagen suministrada como referencia estricta de identidad y acción. Preserva rostro, peinado, proporciones corporales, vestuario distintivo, accesorios, dirección de movimiento, escala del sujeto, posición en pantalla, altura de cámara, distancia focal y fase de acción. Modifica únicamente el entorno, las condiciones climáticas, las partículas secundarias y la iluminación ambiental. En cada transición, el personaje debe continuar la misma acción sin detenerse a posar, sin invertir la dirección, sin cambiar de ropa, sin duplicarse y sin reiniciar el ciclo de movimiento.
Esa lista debe reducirse en planos más sencillos: un retrato en primer plano solo requerirá rostro, expresión y dirección de la mirada; una prueba de baile pondrá el foco en las proporciones corporales, el vestuario y la fluidez del movimiento; y la interacción con objetos exigirá bloquear la relación física entre las manos y el producto.
Cuando necesites calcar una coreografía, un gesto o una interpretación grabada en lugar de depender de movimientos deducidos por la IA, transfiere la actuación real con Motion Control.
Lo que una sola imagen de referencia no puede mostrar
Nuestra ancla en perfil lateral funcionó porque la cámara se mantuvo casi siempre en ese flanco. La imagen apenas ofrece datos para construir un primer plano frontal, una vista posterior o un giro de 360°. Ante esos ángulos no vistos, el modelo se ve forzado a deducir el aspecto del personaje mediante suposiciones generativas.
Las referencias adicionales resultan indispensables cuando la cámara cruza al flanco opuesto, cuando la identidad facial debe resistir tanto en planos cerrados como en planos generales de cuerpo entero, o cuando el vestuario incorpora cortes asimétricos. El mismo criterio se aplica a un accesorio que deba lucir idéntico desde varias perspectivas y a personajes recurrentes generados a lo largo de clips independientes.
Cuando distintos planos generados por etapas deben heredar el mismo personaje, una transferencia controlada de referencias (Anchor Relay) proporciona a cada fase una imagen previa verificada, en lugar de obligar a cada toma a reconstruir el personaje desde cero.
Qué conclusiones permite respaldar esta prueba única
En esta generación, la dirección del movimiento y el color del abrigo constituyeron las señales de continuidad más sólidas. La fase exacta de la zancada, la escala del personaje y la perspectiva geométrica del lente mostraron mayor vulnerabilidad. Estas observaciones sirven de guía para diseñar el próximo experimento, pero una única toma no basta para asegurar que la misma jerarquía de estabilidad se repita con otros personajes, movimientos o modelos.
Si quieres reproducir esta metodología, consulta nuestra comparativa de generadores de imagen a video para evaluar cómo gestiona cada herramienta las imágenes de referencia, y luego comienza con una referencia de acción de perfil en Motiofy. Configurar tres entornos en las primeras pruebas facilitará aislar el primer punto de fallo mucho mejor que utilizar ocho mundos. Audita siempre el material en bruto fotograma a fotograma antes de añadir más escenarios.
