Cómo crear videos de IA a partir de múltiples imágenes de referencia
Nueve imágenes, una generación. Aquí te mostramos exactamente cómo usar el modo de referencia multi-imagen en Seedance 2.0 para obtener videos de IA que realmente coincidan con tu intención visual.

La mayoría de los modelos de video IA utilizan una imagen. Seedance 2.0 Reference utiliza nueve. Eso no es una pequeña diferencia, es la diferencia entre "comenzar desde una imagen fija" y "heredar un lenguaje visual completo."
Este tutorial cubre el flujo de trabajo de múltiples imágenes: cuántas referencias usar, cuáles elegir, cómo se fusionan y cómo solucionar problemas cuando el resultado no coincide con lo que esperabas.
TL;DR
- Seedance 2.0 Reference acepta hasta 9 imágenes por generación
- Más imágenes no siempre es mejor: 4-6 referencias ajustadas a menudo superan a 9 sueltas
- Las 9 se fusionan en un único "vector de estilo" que el modelo aplica al resultado
- El costo es $0,3024/seg independientemente de cuántas referencias subas
- Prueba la generación de múltiples imágenes gratis
Qué sucede cuando subes 9 imágenes
El modelo no trata tus 9 imágenes como fotogramas separados. Las fusiona en una única representación de estilo, un resumen matemático de sus atributos visuales compartidos. Ese resumen guía el resultado.
Si tus 9 imágenes comparten atributos (luz cálida, profundidad de campo reducida, paleta similar), el vector fusionado es fuerte y específico. El resultado se bloquea en ese estilo.
Si tus 9 imágenes se contradicen (algunas cálidas, algunas frías, algunas amplias, algunas cercanas), el vector fusionado se promedia hacia lo genérico y el estilo apenas se ve.
La curaduría importa más que la cantidad.
5 generaciones gratis · Sin tarjeta de crédito
Cuántas referencias usar realmente
| Número | Cuándo usarlo |
|---|---|
| 1-2 | Fotograma único destacado, transferencia de estilo mínima |
| 3-4 | Estilo claro con variación mínima |
| 5-6 | Punto óptimo para la mayoría de proyectos |
| 7-9 | Estilo complejo con múltiples facetas |
El rango de 5-6 es donde aterrizan la mayoría de usuarios experimentados. Hay suficiente variedad para capturar diferentes expresiones del estilo sin diluir la señal con contradicciones.
Ve más alto solo cuando genuinamente tengas más facetas que capturar, por ejemplo, tomas de interiores más tomas de exteriores en el mismo estilo cinematográfico. De lo contrario, 5-6 imágenes ajustadas superarán a 9 sueltas cada vez.
El Marco de Selección de Referencias
Al elegir referencias, cubre estas dimensiones:
Paleta de colores. 1-2 imágenes que muestren claramente tu grado de color objetivo.
Dirección de iluminación. 1-2 imágenes que muestren de dónde viene la luz (dura/suave, alta/baja, cálida/fría).
Composición y encuadre. 1-2 imágenes que muestren tu construcción de tomas preferida (simétrica, regla de los tercios, abierta/cerrada).
Textura y grano. 1 imagen que capture la sensación de detalle fino (grano de película, limpio digital, patrón de ruido).
Tratamiento del sujeto. 1-2 imágenes que muestren cómo los sujetos se manejan usualmente (aislados, mezclados, silueteados).
Si verificas cada dimensión, aterrizarás naturalmente en 5-7 imágenes. Ese es el objetivo.

Construye tu primer paquete multi-imagen. Elige 5-6 imágenes que estén de acuerdo en el estilo y prueba. Comienza gratis con 50 créditos.
Un Ejemplo Curado
Supongamos que quieres el look de las películas de Denis Villeneuve: polvoriento, apagado, de escala épica, temperaturas de color específicas.
Mi paquete:
- Toma ancha del desierto de Dune (escala y paleta)
- Primer plano de un personaje en luz de polvo cálido (temperatura de color)
- Toma de interior de Blade Runner 2049 (paleta apagada, encuadre)
- Toma de niebla de Arrival (atmósfera y luz suave)
- Escena nocturna de Sicario (sesgo azul frío, encuadre de tensión)
- Un fotograma destacado que muestre el vibe exacto que persigo
Seis imágenes. Todas estén de acuerdo con la estética de Villeneuve. El resultado tenderá fuertemente hacia ese look sin importar lo que ponga en el prompt.
Combinación de Múltiples Imágenes con Prompts
Recuerda: las referencias manejan el estilo. Los prompts manejan el sujeto y la acción.
Con 6 referencias de estilo sólidas, tu prompt debe ser puramente descriptivo de lo que sucede:
Una figura en una capa encapuchada camina a través de un vasto salón de sal al atardecer,
el viento azota la tela, toma de seguimiento ancha, 8 segundos
Observa que no hay lenguaje de estilo. Nada de "cinematográfico", nada de "épico", nada de "atmosférico". Las referencias ya están diciendo todo eso más fuerte que las palabras podrían.
Cuando las Referencias se Contradicen
El problema multi-imagen más común es la contradicción. Señales de que tus referencias se están contradiciendo:
- El grado de color del resultado es turbio/promediado
- La iluminación se siente genérica en lugar de específica
- El estilo se siente "como IA" a pesar de las referencias
- Dos clips con las mismas referencias producen looks notablemente diferentes
Solución: elimina las imágenes atípicas 1-2. Prueba de nuevo. Si el problema persiste, probablemente tengas 2+ grupos de estilo incompatibles y necesites comprometerte con uno.
El proceso de depuración: genera un clip de prueba con todas las 9 imágenes. Luego genera de nuevo con la mitad de las imágenes eliminadas. Compara. La versión con menos referencias casi siempre se verá más decidida.
Prueba Seedance 2.0 Reference - generación de video multimodal
9 imágenes, 1 estilo fusionado, 1 video bloqueado. 50 créditos gratis, sin tarjeta requerida.
Prueba Seedance 2.0 Reference GratisEl Concepto del Fotograma Destacado
Entre tus referencias, designa un "fotograma destacado", la única imagen que mejor captura exactamente el vibe que quieres. El modelo aún fusiona todas las referencias equitativamente, pero el fotograma destacado es tu verdadero norte. Si el resultado se aleja del sentimiento del fotograma destacado, sabes que algo en las otras referencias está diluyendo la señal.
Piensa en el fotograma destacado como el objetivo y las otras referencias como contexto que ayuda al modelo a triangularlo. Sin el fotograma destacado, estás describiendo una dirección sin un destino.
Coincidencia de Material Fuente
La referencia de múltiples imágenes es excepcional para adaptar material fuente a video.
Adaptación de una serie de fotos: Alimenta el modelo con 5-6 tomas de la serie. Tus clips de video se verán como continuaciones de la serie.
Adaptación del estilo de una película: Toma 6-8 fotogramas de una película específica. Tu generación se sentirá como si perteneciera a esa película.
Adaptación de la identidad visual de una marca: Usa la mejor imaginería de marketing de la marca como referencias. El resultado coincidirá con la estética de la marca sin que tengas que describirla.
Adaptación de arte conceptual: Sube el arte conceptual como referencias. El resultado animado se verá como el arte conceptual en movimiento.
El Costo No Escala con la Cantidad de Imágenes
Vale la pena repetir: pagas por la duración del resultado, no por la cantidad de entrada. 9 imágenes cuesta lo mismo que 1 imagen. La tarifa base es $0,3024 por segundo de video generado:
| Duración | Créditos | Costo |
|---|---|---|
| 4 segundos | 243 | $2,42 |
| 8 segundos | 484 | $4,84 |
| 15 segundos | 907 | $9,07 |
Entonces cuando dudes, sube la referencia extra. Es gratis y si ayuda al vector fusionado, ganas.
Múltiples Imágenes + Referencia de Movimiento + Referencia de Audio
Puedes combinar los tres tipos de entrada en una única generación. Hasta 9 imágenes, hasta 3 referencias de movimiento, hasta 3 señales de audio. Aquí es donde Seedance 2.0 Reference realmente se diferencia de todos los otros modelos.
Ejemplo de pila completa:
- 9 imágenes definiendo una estética de Wes Anderson
- 1 video de movimiento mostrando un dolly lento y deliberado hacia la izquierda
- 1 clip de audio de una sección de cuerdas alegre
Más un prompt mínimo: Un conserje abre la puerta de un hotel rosa.
El resultado se sentirá 90% como una toma de Wes Anderson sin que tengas que escribir "Wes Anderson" en ningún lado. Ver nuestro guía multimodal para el análisis profundo.
Preguntas Frecuentes
"¿Puedo usar referencias generadas por IA?" Sí. Los fotogramas de Seedream funcionan excelente como entrada de referencia. Incluso puedes generar fotogramas primero, curar los mejores 6, luego usarlos como referencias para video.
"¿Las referencias necesitan ser la misma relación de aspecto que el resultado?" No. El modelo extrae estilo independientemente de las dimensiones.
"¿Puedo reutilizar un paquete en varios proyectos?" Absolutamente. Guarda tus mejores conjuntos de referencias y reutilízalos cuando los proyectos lo requieran. Ver el tutorial de estilo consistente para cómo.
"¿Qué pasa si solo tengo 1 imagen de referencia?" La referencia de múltiples imágenes aún funciona con 1 imagen, pero también podrías considerar Seedance 2.0 Standard que acepta una única imagen directamente.
Tu Primera Generación Multi-Imagen
Elige un estilo que ames. Reúne 5-6 imágenes que lo representen (de cualquier lugar: películas, fotografía, trabajo existente, moodboards). Súbelas a Seedance 2.0 Reference. Escribe un breve prompt describiendo solo el sujeto y la acción. Genera a 5 segundos.
Compara el resultado con tus referencias. Si el estilo se bloqueó, tienes un flujo de trabajo repetible. Si no, ajusta tu paquete e intenta de nuevo.
Dentro de diez minutos, sabrás cómo producir video IA que realmente se vea como tus referencias en lugar de verse como "video IA".
Sube 6 imágenes, obtén 1 video coincidente
Prueba referencias de múltiples imágenes con tu propio moodboard. 50 créditos gratis, sin tarjeta requerida.
Comienza a Crear GratisTry Seedance 2.0 - Right Now
5 free generations · No credit card needed