Video IA multimodal: combina imágenes, video y audio con Arteza
El video IA verdaderamente multimodal significa darle al modelo algo más que un prompt. Así se combinan imágenes, video y referencias de audio en Seedance 2.0 Reference.

"Multi-modal" se usa a la ligera en el marketing de IA. La mayoría de las herramientas que lo afirman en realidad significan "aceptamos texto y una imagen". Seedance 2.0 Reference es uno de los pocos modelos que se toma el término en serio: hasta 9 imágenes, 3 clips de vídeo y 3 clips de audio, todo fusionado en una sola generación.
Aquí te explicamos cómo usar los tres tipos de entrada juntos y por qué la combinación desbloquea cosas que ninguna entrada individual puede lograr.
Resumen rápido
- Seedance 2.0 Reference acepta imágenes + vídeo + audio como referencia en una sola llamada
- Las imágenes determinan el estilo, el vídeo determina el movimiento, el audio determina el estado de ánimo
- Combinar los tres produce resultados más precisos que cualquier tipo de entrada individual
- Precio: $0,3024/seg, independientemente del número de referencias que uses
- Generación: 60-180 segundos para el pipeline multi-modal fusionado
- Prueba gratis el stack multimodal completo
Qué controla realmente cada tipo de entrada
Estos tres tipos de referencia no se superponen: cada uno gestiona una dimensión diferente del resultado.
Las imágenes controlan el estilo. Paleta de colores, iluminación, composición, textura, encuadre. Todo lo visual que no implica movimiento.
El vídeo controla el movimiento. Movimientos de cámara, ritmo, vectores de acción, tempo temporal. No el color ni la iluminación: el modelo extrae el movimiento de forma independiente al estilo visual del vídeo.
El audio controla el estado de ánimo. Un sesgo emocional que inclina sutilmente el resultado visual. No el sonido que escuchas en el resultado (ese se genera por separado), sino la señal de estado de ánimo que influye en lo que aparece en pantalla.
Cuando usas los tres juntos, cada uno cubre un hueco que los demás no pueden cubrir.
5 generaciones gratis · Sin tarjeta de crédito
El stack en acción
Aquí te muestro una generación multi-modal concreta que realicé.
Objetivo: un plano onírico a cámara lenta de una mujer corriendo por un campo al amanecer, al estilo de una película de Terrence Malick.
Referencias de imágenes (6):
- 2 fotogramas de películas de Malick con luz cálida de amanecer
- 2 imágenes de campos en hora dorada
- 1 toma del carácter de objetivo exacto que quería (bokeh suave y onírico)
- 1 fotograma principal con el estado de ánimo preciso
Referencias de vídeo (1):
- Un clip de 3 segundos de una figura corriendo a cámara lenta grabado con un teleobjetivo
Referencias de audio (1):
- 4 segundos de piano suave y minimalista
Prompt:
Una mujer con vestido blanco corre entre hierba alta al amanecer, 8 segundos
Fíjate en lo minimalista que es el prompt. Las referencias se encargan de todo lo demás.
El resultado se acercó de forma sorprendente a la intención: el estilo vino de las imágenes, la sensación específica de carrera a cámara lenta del vídeo, y un peso emocional sutil del audio que no habría podido conseguir solo con imágenes.

Prueba el stack multi-modal completo. Sube imágenes, un clip de movimiento y una referencia de audio de una sola vez. Empieza gratis con 10 créditos.
Referencias de imágenes: la base
Las imágenes son la entrada con mayor peso en la fusión. Siempre deben ser tu canal de estilo principal. Usa un mínimo de 4-6, hasta 9 para estilos complejos.
Consulta el tutorial de múltiples imágenes dedicado para la metodología completa sobre selección de imágenes. Resumen: la coherencia importa más que la cantidad, cubre diferentes facetas del estilo e incluye un fotograma principal.
Referencias de vídeo: la capa de movimiento
Las referencias de vídeo son donde el enfoque multi-modal se diferencia realmente de los flujos de trabajo basados solo en imágenes. Describir el movimiento de cámara con palabras es genuinamente difícil: "un desplazamiento lento a mano alzada hacia la izquierda mientras sube suavemente en grúa" pierde fidelidad cada vez que lo traduces a texto.
Una referencia de vídeo de 2-5 segundos elimina esa traducción. El modelo muestrea los vectores de movimiento directamente.
Mejores usos:
- Sensación específica de cámara en mano que quieres reproducir
- Movimientos de cámara complejos (grúa, combinaciones de travelling + panorámica, transiciones con barrido)
- Señales de ritmo (sensación de cortes rápidos vs. sensación contemplativa lenta)
- Ritmo de acción para contenido deportivo o de danza
Lo que las referencias de vídeo no hacen:
- No transfieren su propio estilo. La gradación de color de la referencia no se aplica: solo el movimiento.
- No dictan el contenido. El sujeto de la referencia no aparece en tu resultado.
Puedes usar hasta 3 referencias de vídeo por generación. Combinar varias referencias de movimiento las mezcla, lo que resulta útil para obtener un movimiento "intermedio" entre dos referencias.
Referencias de audio: la capa de estado de ánimo
Las referencias de audio son las más peculiares de las tres. No aparecen en la pista de audio de tu resultado (esa se genera desde cero para encajar con la escena). En cambio, sesgan visualmente el resultado a nivel emocional.
Una referencia de audio tormentosa inclina el resultado hacia una iluminación dramática y una paleta más oscura. Una referencia alegre y animada inclina hacia un encuadre más luminoso y más movimiento. Una referencia melancólica y minimalista inclina hacia planos más largos y lentos con tonos más fríos.
Cuándo usarlas:
- Las referencias de estilo y el prompt son sólidos, pero el resultado se siente emocionalmente plano
- Quieres un estado de ánimo difícil de describir visualmente
- Estás ajustando el resultado a una banda sonora o canción existente
Cuándo omitirlas:
- En tus primeras generaciones. Empieza solo con imágenes. Añade referencias de audio una vez que te sientas cómodo con la línea base.
Hasta 3 referencias de audio por generación, mezcladas entre sí.
Prueba Seedance 2.0 Reference: generación de vídeo multi-modal
Combina imágenes, vídeo y referencias de audio en una sola generación. Créditos gratuitos, sin tarjeta requerida.
Prueba Seedance 2.0 Reference gratisÁrbol de decisión multi-modal
No todos los proyectos necesitan las tres entradas. Aquí te indicamos cuándo añadir cada una:
Siempre: referencias de imágenes (mínimo 3) Añade referencia de vídeo si: necesitas un movimiento específico difícil de describir Añade referencia de audio si: tu resultado se siente emocionalmente desajustado tras los intentos solo con imágenes
No fuerces el enfoque multi-modal cuando un stack más simple funciona. Las generaciones solo con imágenes son más rápidas de configurar y suelen ser suficientes.
Errores comunes con el enfoque multi-modal
Contradecir las imágenes con el vídeo. Si tus imágenes son lentas y con atmósfera, pero tu referencia de vídeo es rápida y luminosa, la fusión se desorienta. Elige entradas que sean coherentes entre sí.
Usar referencias de vídeo para el estilo. Son solo para el movimiento. El estilo sigue viniendo de las imágenes.
Abusar de las referencias de audio. Una sola señal de audio bien elegida es más efectiva que 3 que se contradicen.
Omitir el prompt. Las referencias definen el cómo; el prompt sigue definiendo el qué. No dejes el prompt en blanco.
Coste y tiempo de generación
El precio del enfoque multi-modal es idéntico al de cualquier otra llamada en modo Reference: $0,3024 por segundo de resultado. Añadir referencias de vídeo y audio no tiene coste adicional.
| Duración | Créditos | Coste |
|---|---|---|
| 4 seg | 19 | $1,90 |
| 8 seg | 37 | $3,70 |
| 15 seg | 69 | $6,90 |
El tiempo de generación es ligeramente mayor que el de solo imágenes, porque la fusión procesa más datos. Espera entre 90 y 180 segundos para llamadas multi-modal, frente a los 60-120 de solo imágenes.
Un flujo de trabajo de producción multi-modal completo
Para un proyecto de 10 clips en el que todos deben coincidir:
1. Construye tu bundle de referencias (una vez, reutilízalo para los 10 clips):
- 6 imágenes que definan el estilo
- 2 referencias de vídeo para tus movimientos de cámara más usados
- 1 referencia de audio para el tono emocional
2. Escribe 10 prompts específicos de cada plano que describan solo el sujeto y la acción.
3. Ejecuta las 10 generaciones usando el mismo bundle de referencias, variando solo el prompt.
4. Revisa e itera en los clips que se hayan desviado. Normalmente 1-2 de cada 10.
Coste total para 10 clips de 8 segundos: 4.840 créditos = **$48**. Eso cabe dentro del $50 nivel Pro con créditos de sobra.
Comparativa: multi-modal vs. estándar
| Capacidad | Seedance 2.0 estándar | Reference (multi-modal) |
|---|---|---|
| Control de estilo | Solo prompt | Hasta 9 imágenes |
| Control de movimiento | Solo prompt | Hasta 3 referencias de vídeo |
| Control de estado de ánimo | Solo prompt | Hasta 3 referencias de audio |
| Complejidad de configuración | Baja | Moderada |
| Precisión del resultado | Moderada | Alta |
| Ideal para | Trabajos puntuales | Trabajos de precisión |
El modo estándar es más rápido para ideas sencillas. El multi-modal Reference es la opción de precisión cuando necesitas que el resultado se ajuste a una intención específica. Consulta la Comparativa Reference vs Standard completa.
Avanzado: capas de referencias en una secuencia
Para secuencias de varios planos con momentos diferenciados, puedes cambiar tu stack multi-modal entre planos manteniendo uno constante.
Constante a lo largo de la secuencia: 5-6 imágenes de estilo (para coherencia visual) Variable por plano: 1-2 imágenes específicas del plano + 1 referencia de movimiento
Las imágenes constantes cohesionan la secuencia. Las referencias variables te permiten capturar los matices específicos de cada plano. Este es el flujo de trabajo en el que acaban la mayoría de los usuarios avanzados.
Por dónde seguir
Si es tu primera vez con el enfoque multi-modal, empieza poco a poco. Prueba primero las generaciones solo con imágenes (tutorial de múltiples imágenes). Una vez que te sientas cómodo, añade una referencia de movimiento. Cuando obtengas resultados consistentes, experimenta con el audio.
Para una visión completa de las funciones, lee el Guía de Seedance 2.0 Reference. Para casos de uso específicos, consulta videos de marca o videos musicales.
El enfoque multi-modal no es un truco: es la función que diferencia a Seedance 2.0 Reference de todas las demás herramientas de vídeo con IA del mercado. Úsalo cuando la precisión importa.
Combina imágenes, vídeo y audio en una sola llamada
Descubre cómo la entrada multi-modal perfecciona el resultado de tu vídeo con IA. Créditos gratuitos, sin tarjeta requerida.
Empieza a crear gratisPrueba Seedance 2.0 - ¡Ahora mismo!
5 generaciones gratis · Sin tarjeta de crédito