Cómo crear videos de IA a partir de múltiples imágenes de referencia
Nueve imágenes, una generación. Así es exactamente cómo usar el modo de referencia multimagen en Seedance 2.0 para obtener videos de IA que realmente coincidan con tu intención visual.

La mayoría de los modelos de video con IA aceptan una imagen. Seedance 2.0 Reference acepta nueve. No es una diferencia pequeña: es la diferencia entre "empezar desde una imagen fija" y "heredar todo un lenguaje visual".
Este tutorial cubre el flujo de trabajo con múltiples imágenes: cuántas referencias usar, cuáles elegir, cómo se fusionan y cómo solucionar problemas cuando el resultado no coincide con lo esperado.
Resumen rápido
- Seedance 2.0 Reference acepta hasta 9 imágenes por generación
- Más imágenes no siempre es mejor: 4-6 referencias bien elegidas suelen superar a 9 sin criterio
- Las 9 se fusionan en un único "vector de estilo" que el modelo aplica al resultado
- El costo es $0,3024/seg independientemente de cuántas referencias subas
- Prueba la generación de múltiples imágenes gratis
Qué ocurre cuando subes 9 imágenes
El modelo no trata tus 9 imágenes como fotogramas separados. Las fusiona en una única representación de estilo, un resumen matemático de sus atributos visuales compartidos. Ese resumen guía el resultado.
Si tus 9 imágenes comparten atributos (luz cálida, poca profundidad de campo, paleta similar), el vector fusionado es fuerte y específico. El resultado se ancla a ese estilo.
Si tus 9 imágenes no coinciden (algunas cálidas, otras frías, algunas abiertas, otras cerradas), el vector fusionado tiende hacia lo genérico y el estilo apenas se percibe.
La curaduría importa más que la cantidad.
5 generaciones gratis · Sin tarjeta de crédito
Cuántas referencias usar realmente
| Número | Cuándo usarlo |
|---|---|
| 1-2 | Fotograma protagonista único, transferencia de estilo mínima |
| 3-4 | Estilo definido con variación mínima |
| 5-6 | El punto óptimo para la mayoría de proyectos |
| 7-9 | Estilo complejo con múltiples facetas |
El rango de 5-6 es donde aterrizan la mayoría de los usuarios con experiencia. Es suficiente variedad para capturar las distintas expresiones de un estilo sin diluir la señal con contradicciones.
Sube más solo cuando genuinamente tengas más facetas que capturar, por ejemplo, tomas interiores y exteriores dentro del mismo estilo cinematográfico. De lo contrario, 5-6 imágenes bien elegidas superarán a 9 sueltas en todos los casos.
El marco para seleccionar referencias
Al elegir referencias, cubre estas dimensiones:
Paleta de color. 1-2 imágenes que muestren claramente tu gradación de color objetivo.
Dirección de la luz. 1-2 imágenes que indiquen de dónde viene la luz (dura/suave, alta/baja, cálida/fría).
Composición y encuadre. 1-2 imágenes que muestren tu construcción de plano preferida (simétrica, regla de los tercios, cerrada/abierta).
Textura y grano. 1 imagen que capture la sensación de detalle fino (grano de película, limpieza digital, patrón de ruido).
Tratamiento del sujeto. 1-2 imágenes que muestren cómo se suele tratar al sujeto (aislado, integrado, en silueta).
Si cubres cada dimensión, llegarás de forma natural a 5-7 imágenes. Ese es el objetivo.

Crea tu primer paquete de múltiples imágenes. Elige 5-6 imágenes que coincidan en estilo y prueba. Empieza gratis con 10 créditos.
Un ejemplo con curaduría
Supongamos que quieres la estética de las películas de Denis Villeneuve: polvorienta, apagada, de escala épica, con temperaturas de color muy concretas.
Mi paquete:
- Plano general del desierto de Dune (escala y paleta)
- Primer plano de un personaje con luz cálida y polvorosa (temperatura de color)
- Plano interior de Blade Runner 2049 (paleta apagada, encuadre)
- Plano de niebla de Arrival (atmósfera y luz suave)
- Escena nocturna de Sicario (predominio del azul frío, encuadre de tensión)
- Un fotograma protagonista que muestre exactamente el ambiente que busco
Seis imágenes. Todas coinciden en la estética de Villeneuve. El resultado se inclinará decididamente hacia ese look independientemente de lo que escriba en el prompt.
Combinar múltiples imágenes con prompts
Recuerda: las referencias definen el estilo. Los prompts definen el sujeto y la acción.
Con 6 referencias de estilo sólidas, tu prompt debe ser puramente descriptivo de lo que ocurre:
Una figura con capa encapuchada camina por una inmensa planicie de sal al atardecer,
el viento agita la tela, plano de seguimiento amplio, 8 segundos
Observa que no hay ningún lenguaje de estilo. Sin "cinematográfico", sin "épico", sin "atmosférico". Las referencias ya están diciendo todo eso con más fuerza que cualquier palabra.
Cuando las referencias se contradicen
El problema más común con múltiples imágenes es la contradicción. Señales de que tus referencias están en conflicto:
- La gradación de color del resultado es turbia o promediada
- La iluminación parece genérica en lugar de específica
- El estilo tiene aspecto de "IA" a pesar de las referencias
- Dos clips con las mismas referencias producen looks notablemente distintos
Solución: elimina las 1-2 imágenes que no encajan. Prueba de nuevo. Si el problema persiste, probablemente tienes 2 o más grupos de estilo incompatibles y necesitas comprometerte con uno.
El proceso de diagnóstico: genera un clip de prueba con las 9 imágenes. Luego genera de nuevo con la mitad de las imágenes eliminadas. Compara. La versión con menos referencias casi siempre se verá más decidida.
Prueba Seedance 2.0 Reference: generación de video multimodal
9 imágenes, 1 estilo fusionado, 1 video coherente. Créditos gratis, sin tarjeta requerida.
Prueba Seedance 2.0 Reference gratisEl concepto del fotograma protagonista
Entre tus referencias, designa un "fotograma protagonista": la imagen única que mejor capture exactamente el ambiente que quieres. El modelo sigue fusionando todas las referencias por igual, pero el fotograma protagonista es tu norte verdadero. Si el resultado se aleja de la sensación del fotograma protagonista, sabes que algo en las otras referencias está diluyendo la señal.
Piensa en el fotograma protagonista como el destino y en las demás referencias como el contexto que ayuda al modelo a triangularlo. Sin el fotograma protagonista, estás describiendo una dirección sin un punto de llegada.
Adaptar material de origen
La referencia con múltiples imágenes es excepcional para adaptar material de origen a video.
Adaptar una serie fotográfica: Introduce en el modelo 5-6 tomas de la serie. Tus clips de video parecerán continuaciones de esa serie.
Adaptar el estilo de una película: Toma 6-8 fotogramas de una película concreta. Tu generación parecerá pertenecer a esa película.
Adaptar la identidad visual de una marca: Usa las mejores imágenes de marketing de la marca como referencias. El resultado coincidirá con la estética de la marca sin que tengas que describirla.
Adaptar arte conceptual: Sube el arte conceptual como referencias. El resultado animado parecerá ese arte conceptual en movimiento.
El costo no escala con el número de imágenes
Vale la pena repetirlo: pagas por la duración del resultado, no por la cantidad de imágenes de entrada. 9 imágenes cuesta lo mismo que 1 imagen. La tarifa base es $0,3024 por segundo de video generado:
| Duración | Créditos | Costo |
|---|---|---|
| 4 segundos | 19 | $1,90 |
| 8 segundos | 37 | $3,70 |
| 15 segundos | 69 | $6,90 |
Así que si tienes dudas, sube la referencia extra. Es gratis y, si ayuda al vector fusionado, ganas.
Múltiples imágenes + referencia de movimiento + referencia de audio
Puedes combinar los tres tipos de entrada en una sola generación: hasta 9 imágenes, hasta 3 referencias de movimiento y hasta 3 pistas de audio. Aquí es donde Seedance 2.0 Reference realmente se distancia de todos los demás modelos.
Ejemplo con el stack completo:
- 9 imágenes que definen la estética de Wes Anderson
- 1 video de movimiento que muestra un dolly lento y deliberado hacia la izquierda
- 1 clip de audio de una sección de cuerdas punzante
Más un prompt mínimo: Un conserje abre la puerta de un hotel rosa.
El resultado tendrá un 90% de aspecto de plano de Wes Anderson sin que hayas escrito "Wes Anderson" en ningún lugar. Consulta nuestro guía multimodal para profundizar en el tema.
Preguntas frecuentes
"¿Puedo usar referencias generadas por IA?" Sí. Las imágenes fijas generadas con Seedream funcionan muy bien como entrada de referencia. Incluso puedes generar imágenes primero, elegir las 6 mejores y usarlas como referencias para video.
"¿Las referencias necesitan tener la misma relación de aspecto que el resultado?" No. El modelo extrae el estilo de forma independiente a las dimensiones.
"¿Puedo reutilizar un paquete en distintos proyectos?" Por supuesto. Guarda tus mejores conjuntos de referencias y reutilízalos cuando un proyecto requiera ese estilo. Consulta tutorial de estilo consistente para ver cómo hacerlo.
"¿Qué pasa si solo tengo 1 imagen de referencia?" La referencia con múltiples imágenes sigue funcionando con 1 imagen, pero también puedes considerar Seedance 2.0 estándar, que acepta una sola imagen directamente.
Tu primera generación con múltiples imágenes
Elige un estilo que te guste. Reúne 5-6 imágenes que lo representen (de cualquier fuente: películas, fotografía, trabajos existentes, moodboards). Súbelas a Seedance 2.0 Reference. Escribe un prompt corto que describa únicamente el sujeto y la acción. Genera a 5 segundos.
Compara el resultado con tus referencias. Si el estilo se fijó, tienes un flujo de trabajo repetible. Si no lo hizo, ajusta tu paquete y vuelve a intentarlo.
En diez minutos sabrás cómo producir video con IA que realmente se parece a tus referencias en lugar de parecer simplemente "video de IA".
Sube 6 imágenes, obtén 1 video a juego
Prueba la referencia con múltiples imágenes usando tu propio moodboard. Créditos gratis, sin tarjeta requerida.
Empieza a crear gratisPrueba Seedance 2.0 - ¡Ahora mismo!
5 generaciones gratis · Sin tarjeta de crédito