Vídeo de IA Multi-Modal: Combinando Imágenes, Vídeo y Audio con Arteza
El verdadero vídeo de IA multi-modal significa alimentar el modelo con más que solo un prompt. Aquí te mostramos cómo combinar referencias de imágenes, vídeo y audio en Seedance 2.0 Reference.

"Multi-modal" se usa de forma muy vaga en el marketing de IA. La mayoría de herramientas que lo reclaman en realidad significan "aceptamos texto e una imagen". Seedance 2.0 Reference es uno de los pocos modelos que se toma el término en serio: hasta 9 imágenes, 3 clips de video y 3 clips de audio, todos fusionados en una única generación.
Aquí te mostramos cómo usar realmente los tres tipos de entrada juntos, y por qué la combinación desbloquea cosas que ninguna entrada única puede lograr.
TL;DR
- Seedance 2.0 Reference acepta imágenes + video + audio como referencia en una sola llamada
- Las imágenes impulsan el estilo, el video impulsa el movimiento, el audio impulsa el estado de ánimo
- Combinar los tres produce resultados más precisos que cualquier tipo de entrada única
- Precios: $0,3024/seg, sin importar cuántas referencias uses
- Generación: 60-180 segundos para la canalización multi-modal fusionada
- Prueba toda la pila multimodal gratis
Qué controla realmente cada tipo de entrada
Estos tres tipos de referencia no se superponen: manejan diferentes dimensiones de la salida.
Las imágenes controlan el estilo. Paleta de colores, iluminación, composición, textura, encuadre. Todo lo visual que no implica movimiento.
El video controla el movimiento. Movimientos de cámara, ritmo, vectores de acción, ritmo temporal. No color ni iluminación: el modelo extrae el movimiento independientemente del estilo visual del video.
El audio controla el estado de ánimo. Sesgo emocional que inclina sutilmente la salida visual. No el sonido que escuchas en la salida (eso se genera por separado), sino la pista de estado de ánimo que influye en lo que aparece en pantalla.
Cuando usas los tres juntos, cada uno llena un vacío que los otros no pueden.
5 generaciones gratis · Sin tarjeta de crédito
El stack en acción
Aquí hay una generación multi-modal concreta que ejecuté.
Objetivo: Una toma onírica en cámara lenta de una mujer corriendo por un campo al amanecer, al estilo de una película de Terrence Malick.
Referencias de imagen (6):
- 2 fotogramas de películas de Malick que muestran luz cálida al amanecer
- 2 imágenes de campos a la hora dorada
- 1 toma del carácter de lente exacto que quería (bokeh suave y onírico)
- 1 fotograma principal que muestra el estado de ánimo preciso
Referencias de video (1):
- Un clip de 3 segundos de una figura corriendo en cámara lenta grabado con un lente largo
Referencias de audio (1):
- 4 segundos de piano suave y disperso
Prompt:
A woman in a white dress runs through tall grass at dawn, 8 seconds
Observa lo mínimo que es el prompt. Las referencias manejan todo lo demás.
La salida fue sorprendentemente cercana a la intención: el estilo de las imágenes, la sensación específica de carrera en cámara lenta del video, y un peso emocional sutil del audio que no habría podido obtener solo con imágenes.

Prueba el stack multi-modal completo. Carga imágenes, un clip de movimiento y una referencia de audio en una sola toma. Comienza gratis con 50 créditos.
Referencias de imagen: La base
Las imágenes son la entrada con mayor peso en la fusión. Siempre deben ser tu canal de estilo primario. Usa 4-6 como mínimo, hasta 9 para estilos complejos.
Consulta la dedicada tutorial de múltiples imágenes para la metodología completa sobre curación de imágenes. Resumen: el acuerdo importa más que la cantidad, cubre diferentes facetas del estilo, incluye un fotograma principal.
Referencias de video: La capa de movimiento
Las referencias de video son donde multi-modal realmente se diferencia de los flujos de trabajo basados solo en imágenes. Describir el movimiento de cámara con palabras es genuinamente difícil: "una derivación manual lenta a la izquierda mientras sutilmente se eleva hacia arriba" pierde fidelidad cada vez que lo traduces a prosa.
Una referencia de video de 2-5 segundos omite la traducción. El modelo muestrea vectores de movimiento directamente.
Mejores usos:
- Sensación manual específica que deseas igualar
- Movimientos de cámara complicados (grúa, combos dolly + paneo, transiciones rápidas)
- Pistas de ritmo (sensación de cortes rápidos vs sensación contemplativa lenta)
- Ritmo de acción para contenido de deportes o danza
Lo que las referencias de video no hacen:
- No llevan su propio estilo. La gradación de color de la referencia no se transferirá: solo el movimiento.
- No dictan contenido. El sujeto en la referencia no aparece en tu salida.
Puedes usar hasta 3 referencias de video por generación. Apilar múltiples referencias de movimiento las mezcla: útil para obtener "entre" dos movimientos de referencia.
Referencias de audio: La capa de estado de ánimo
Las referencias de audio son las más extrañas de las tres. No aparecen en la pista de audio de tu salida (eso se genera de nuevo para coincidir con la escena). En su lugar, empujan los visuales emocionalmente.
Una referencia de audio de tormenta sesga hacia iluminación dramática y paleta más oscura. Una referencia de tempo rápido y alegre sesga hacia encuadre más brillante y más movimiento. Una referencia de melancolía dispersa sesga hacia tomas más largas y lentas con tonos más fríos.
Cuándo usarlas:
- Las referencias de estilo y el prompt son sólidos pero la salida se siente emocionalmente plana
- Quieres un estado de ánimo que es difícil describir visualmente
- Estás igualando la salida a una partitura o canción existente
Cuándo omitirlas:
- Tus primeras generaciones. Comienza solo con imágenes. Agrega referencias de audio una vez que te sientas cómodo con la línea de base.
Hasta 3 referencias de audio por generación, mezcladas juntas.
Prueba Seedance 2.0 Reference - generación de video multi-modal
Combina imágenes, video y referencias de audio en una generación. 50 créditos gratis, sin tarjeta requerida.
Prueba Seedance 2.0 Reference gratisEl árbol de decisión multi-modal
No todo proyecto necesita las tres entradas. Aquí es cuándo agregar cada una:
Siempre: Referencias de imagen (3+ mínimo) Agrega referencia de video si: Necesitas movimiento específico que sea difícil de describir Agrega referencia de audio si: Tu salida se siente emocionalmente incorrecta después de intentos solo con imágenes
No fuerces multi-modal cuando un stack más simple funciona. Las generaciones solo con imágenes son más rápidas de configurar y a menudo suficientes.
Errores comunes con multi-modal
Contradecir las imágenes con el video. Si tus imágenes son melancólicas y lentas pero tu referencia de video es rápida y brillante, la fusión se confunde. Elige entradas que estén de acuerdo.
Usar referencias de video para estilo. Son solo movimiento. El estilo aún proviene de imágenes.
Usar excesivamente referencias de audio. Una sola pista de audio ajustada es más efectiva que 3 contradictorias.
Omitir el prompt. Las referencias definen cómo, el prompt aún define qué. No dejes el prompt en blanco.
Costo y tiempo de generación
El precio multi-modal es idéntico a cualquier otra llamada en modo Reference: $0,3024 por segundo de salida. Agregar referencias de video y audio no cuesta extra.
| Duración | Créditos | Costo |
|---|---|---|
| 4 seg | 243 | $2,42 |
| 8 seg | 484 | $4,84 |
| 15 seg | 907 | $9,07 |
El tiempo de generación es ligeramente más largo que solo con imágenes porque la fusión procesa más datos. Espera 90-180 segundos para llamadas multi-modal versus 60-120 para solo con imágenes.
Un flujo de trabajo de producción multi-modal completo
Para un proyecto de 10 clips donde cada clip necesita coincidir:
1. Construye tu bundle de referencia (una vez, reutiliza para los 10 clips):
- 6 imágenes que definan el estilo
- 2 referencias de video para tus movimientos de cámara más utilizados
- 1 referencia de audio para el tono emocional
2. Escribe 10 prompts específicos de toma que describan solo el sujeto y la acción.
3. Ejecuta las 10 generaciones usando el mismo bundle de referencia, variando solo el prompt.
4. Revisa e itera en cualquier clip que se haya desviado. Generalmente 1-2 de 10.
Costo total para 10 clips a 8 segundos: 4.840 créditos = **$48**. Eso está dentro del $50 Pro tier con cambio restante.
Comparación multi-modal vs estándar
| Capacidad | Seedance 2.0 estándar | Reference (multi-modal) |
|---|---|---|
| Control de estilo | Solo prompt | Hasta 9 imágenes |
| Control de movimiento | Solo prompt | Hasta 3 referencias de video |
| Control de estado de ánimo | Solo prompt | Hasta 3 referencias de audio |
| Complejidad de configuración | Baja | Moderada |
| Precisión de salida | Moderada | Alta |
| Mejor para | Proyectos únicos | Trabajo de precisión |
Estándar es más rápido para ideas simples. Reference multi-modal es la opción de precisión cuando necesitas que la salida coincida con una intención específica. Consulta la completa Desglose de Reference vs Standard.
Avanzado: Apilando referencias en una secuencia
Para secuencias de múltiples tomas con momentos distintos, puedes cambiar tu stack multi-modal entre tomas mientras mantienes uno constante.
Constante en la secuencia: 5-6 imágenes de estilo (para consistencia visual) Variable por toma: 1-2 imágenes específicas de toma + 1 referencia de movimiento
Las imágenes constantes cierran la secuencia. Las referencias variables te permiten capturar el matiz específico de la toma. Este es el flujo de trabajo en el que aterrizan la mayoría de usuarios profesionales.
Por dónde continuar
Si esta es tu primera vez con multi-modal, comienza en pequeño. Prueba primero generaciones solo con imágenes (tutorial de múltiples imágenes). Una vez que te sientas cómodo, agrega una referencia de movimiento. Una vez que obtengas resultados confiables, experimenta con audio.
Para la imagen completa de funciones, lee el Guía de Seedance 2.0 Reference. Para casos de uso específicos, consulta videos de marca o videos musicales.
Multi-modal no es un truco: es la característica que diferencia a Seedance 2.0 Reference de cualquier otra herramienta de video de IA en el mercado. Úsalo cuando la precisión importa.
Apila imágenes, video y audio en una sola llamada
Observa cómo la entrada multi-modal bloquea tu salida de video de IA. 50 créditos gratis, sin tarjeta requerida.
Comienza a crear gratisTry Seedance 2.0 - Right Now
5 free generations · No credit card needed