Generación de video con IA multi-entrada: guía completa
El video con IA multi-entrada consiste en proporcionar al modelo algo más que texto. Aquí tienes la guía completa para usar imágenes, video y entradas de audio en Seedance 2.0 Reference.

La próxima fase del video con IA no son mejores prompts, sino mejores entradas. Durante dos años, el sector ha optimizado una sola palanca: el prompt de texto. Esa palanca está llegando a su límite. El verdadero avance está en aceptar entradas más ricas: imágenes, clips de video, audio y combinaciones de los tres.
Seedance 2.0 Reference es el modelo de video con IA multi-entrada más completo disponible actualmente, y esta es la guía definitiva para usar cada tipo de entrada en conjunto.
Resumen
- Multi-entrada = texto + hasta 9 imágenes + hasta 3 clips de video + hasta 3 clips de audio
- Cada tipo de entrada controla distintas dimensiones del resultado (estilo, movimiento, ambiente)
- Todo se fusiona en una sola generación a $0,3024/seg
- Tiempo de generación: 60-180 segundos independientemente del número de entradas
- El flujo de trabajo más eficaz para obtener video con IA de precisión
- Prueba gratis el stack completo de múltiples entradas
Por qué importan las múltiples entradas
El texto es información visual comprimida. Cuando escribes «sombrío, cálido, cinematográfico», tomas un concepto visual rico y lo comprimes con pérdida en siete sílabas. El modelo tiene que volver a expandir esas siete sílabas en imágenes, y esa expansión pierde información.
Las múltiples entradas se saltan el paso de compresión. En lugar de describir tu estilo con palabras, lo muestras directamente. En lugar de describir el movimiento, lo muestras. En lugar de describir el ambiente, lo muestras. El modelo lee tus entradas con total fidelidad.
El resultado es un output que se ajusta a la intención con mayor precisión, en la primera generación y sin tanta iteración de prompts.
5 generaciones gratis · Sin tarjeta de crédito
Los cuatro tipos de entrada
1. Prompt de texto (obligatorio). Lo único que debe hacer el texto en un flujo de trabajo multi-entrada: describir el sujeto y la acción. El estilo, el ambiente y el movimiento déjalos para las otras entradas.
2. Imágenes de referencia (hasta 9). Entrada de estilo principal. Cubre color, iluminación, composición, grano y textura.
3. Videos de referencia (hasta 3). Entrada de movimiento. Captura movimientos de cámara, ritmo y cadencia de acción.
4. Audio de referencia (hasta 3). Entrada de ambiente. Influye emocionalmente en el resultado visual, no a través de la pista de audio real del output.
Juntos, te dan control sobre cada dimensión del resultado sin depender del texto para hacerlo todo.
Cómo funciona la fusión
Internamente, Seedance 2.0 Reference procesa cada tipo de entrada a través de codificadores dedicados y fusiona los resultados en una única señal de condicionamiento. El prompt de texto pasa por un codificador de texto; las imágenes, por un codificador de imágenes; el video, por un codificador de movimiento; y el audio, por un codificador de ambiente de audio.
La señal de condicionamiento fusionada se usa para guiar el proceso de generación de video. Tú no ves nada de esto: solo ves que las entradas entran y el video sale. Pero entender la fusión te ayuda a pensar qué entradas conviene ponderar más.
Orden aproximado de peso:
- Texto: influencia fuerte en el sujeto y la acción
- Imágenes: influencia fuerte en el estilo visual
- Video: influencia fuerte en el movimiento
- Audio: influencia sutil en el ambiente visual
La ausencia de un tipo de entrada no rompe la generación. Simplemente deja esa dimensión al comportamiento por defecto, lo cual suele estar bien para trabajos más sencillos.

Ejecuta tu primera generación multi-entrada. Sube los tres tipos de entradas y comprueba la precisión. Empieza gratis.
Un ejemplo completo de multi-entrada
Aquí tienes una generación con todos los tipos de entrada utilizados.
Prompt de texto:
Una mujer con chaqueta de cuero sentada en una moto en un
callejón iluminado con neón por la noche, la cámara avanza lentamente, 8 segundos
Imágenes de referencia (7):
- 3 fotogramas de Blade Runner (color, iluminación)
- 2 fotos de fotografía cyberpunk (composición, grano)
- 1 foto de producto de una moto (posicionamiento del sujeto)
- 1 fotograma protagonista (objetivo de ambiente general)
Video de referencia (1):
- Clip de 3 segundos de un dolly lento avanzando hacia un sujeto
Audio de referencia (1):
- Clip de 5 segundos de un drone de sintetizador con lluvia sutil
Resultado:
- Estilo: muy influenciado por Blade Runner, fijado por las imágenes
- Movimiento: coincide con la referencia del dolly con precisión
- Ambiente: atmósfera sutil de lluvia gracias a la señal de audio
Total de entradas: 7 imágenes + 1 video + 1 audio + 1 prompt. Tiempo de generación: ~120 segundos. Resultado: exactamente lo que quería en el primer intento.
Compara eso con los flujos de trabajo solo con prompt, donde a menudo hacen falta 5-10 generaciones para aproximarse al aspecto deseado. Las múltiples entradas ahorran coste de iteración y se ajustan a la intención con mayor precisión.
Cuándo añadir cada tipo de entrada
No siempre necesitas los cuatro. Aquí tienes cuándo cada uno aporta valor.
Solo texto: Nunca. Siempre necesitas al menos un tipo de referencia para el modo Reference.
Texto + imágenes: La configuración más habitual. Funciona para el 70% de los proyectos.
Texto + imágenes + video: Cuando necesitas un movimiento específico que es difícil de describir.
Texto + imágenes + audio: Cuando el ambiente debe ir más allá de lo que las imágenes solas pueden capturar.
Los cuatro: Cuando la máxima precisión importa: trabajos de marca, planos protagonistas, entregables finales.
Empieza con texto + imágenes y añade otras entradas cuando alcances los límites de esa configuración.
Flujos de trabajo multi-entrada para diferentes casos de uso
Para videos de marca: Texto + 6-9 imágenes de marca + 1-2 referencias de movimiento que muestren tu estilo de cámara característico. Omite referencias de audio a menos que tengas un objetivo de ambiente concreto.
Para videos musicales: Texto + 6-9 imágenes de estilo + 1 referencia de audio que coincida con el ambiente de la canción. Las referencias de video son opcionales.
Para storyboards: Texto + 4-6 imágenes de concept art + 1 referencia de movimiento por tipo de plano. Omite el audio.
Para lanzamientos de producto: Texto + 5-7 fotos del producto + 1 referencia de movimiento de lifestyle o marca. Omite el audio a menos que el producto tenga asociaciones de ambiente.
Para editorial o moda: Texto + 6-9 fotos de lookbook + 1 referencia de movimiento de pasarela o posado. Omite el audio a menos que el shooting tenga una banda sonora asociada.
Prueba Seedance 2.0 Reference: generación de video multimodal
Control multi-entrada completo: referencias de imágenes, video y audio en una sola llamada. Créditos gratuitos, sin tarjeta requerida.
Prueba Seedance 2.0 Reference gratisConsideraciones sobre coste y velocidad
Las generaciones multi-entrada tienen el mismo coste por segundo que las de entrada única: $0,3024 por segundo de output. Añadir tipos de referencia no aumenta el coste.
| Duración | Créditos | Coste |
|---|---|---|
| 4 seg | 19 | $1,90 |
| 8 seg | 37 | $3,70 |
| 15 seg | 69 | $6,90 |
Velocidad: Las generaciones multi-entrada tardan algo más que las de solo texto porque el modelo procesa más datos de entrada. Espera entre 90 y 180 segundos para llamadas multi-entrada frente a los 60-120 de las llamadas solo con imagen. La espera adicional casi siempre vale la pena por la ganancia en precisión.
Errores comunes en multi-entrada
Entradas contradictorias. Si tus imágenes dicen «sombrío y lento» y tu audio dice «animado y rápido», la fusión se confunde. Elige entradas que coincidan en el ambiente.
Usar referencias de video para el estilo. Las referencias de video influyen solo en el movimiento, no en el estilo. No las elijas en función de su aspecto visual.
Sobrecargar el audio. Una o dos referencias de audio suelen ser suficientes. Tres pueden diluir la señal de ambiente.
Omitir el prompt. Incluso con referencias sólidas, necesitas un prompt de texto para el sujeto y la acción. Un prompt en blanco producirá contenido genérico.
Cambiar las entradas entre clips de una serie. Si produces varios clips que deben parecer relacionados, usa conjuntos de referencias idénticos en todos ellos.
Comparación entre multi-entrada y entrada única
Aquí tienes una comparación en paralelo que hice con el mismo escenario.
Escenario: Clip atmosférico corto de una calle urbana empapada de lluvia de noche.
Intento solo con texto:
Plano atmosférico de una calle urbana empapada de lluvia de noche, reflejos de neón,
iluminación cinematográfica sombría, empuje lento de cámara, 5 segundos
Resultado: Decente pero genérico. Podría ser cualquier clip de IA al estilo noir. Lo conseguí en la 4.ª generación tras iterar el prompt.
Intento multi-entrada:
- Mismo prompt sin el lenguaje de estilo
- 6 fotogramas de Blade Runner
- 1 referencia de video con dolly push
- 1 referencia de audio con sintetizador de lluvia
Resultado: Específico, fijado, coincidió con el ambiente que buscaba en el primer intento.
Ahorro de tiempo: ~8 minutos de iteración eliminados. Ahorro de coste: 3 intentos de generación menos a ~$3 cada uno = ~$9 ahorrados.
Multiplicado por un proyecto de 20 o más clips, los flujos de trabajo multi-entrada se amortizan muchas veces.
Multi-entrada frente a Seedance 2.0 estándar
Vale la pena señalarlo: Seedance 2.0 estándar es un motor de texto a video e imagen a video. Es de entrada única. Si solo necesitas un prompt y una imagen, el estándar es más rápido de configurar.
La multi-entrada con Seedance 2.0 Reference es para cuando la precisión importa más que la velocidad de configuración. Consulta el Comparación Reference vs Standard completo para ver el marco de decisión.
Consejos para preparar las entradas
Imágenes: 512 px o más en el lado corto, JPG o PNG, idealmente de una fuente de estilo coherente.
Video: 2-5 segundos por clip, cualquier relación de aspecto, MP4 preferido.
Audio: 4-10 segundos por clip, MP3 o WAV, que coincida con tu ambiente objetivo.
No sobreingeniericen la preparación de entradas. El modelo es bastante tolerante con la resolución, el formato y el tamaño de archivo. Lo que importa es la relevancia del contenido, no la perfección técnica.
Construir una biblioteca de entradas multi-uso
Los usuarios avanzados crean una biblioteca personal de entradas reutilizables:
- Paquetes de estilo para diferentes géneros y ambientes (noir, pastoral, épico, etc.)
- Clips de movimiento para movimientos de cámara habituales (dolly in, cámara en mano, plano fijo, etc.)
- Señales de audio para tonos emocionales (melancólico, esperanzador, tenso, etc.)
Con una biblioteca, comenzar un nuevo proyecto consiste en combinar entradas existentes en lugar de buscar todo desde cero. Desarrollas un «sonido», un estilo reconocible que se mantiene en toda tu obra porque tus entradas son coherentes.
Para ir más lejos
Para una inmersión práctica en la combinación multimodal, lee video de IA multimodal. Para el flujo de trabajo específico de imágenes, consulta tutorial de múltiples imágenes. Para el desglose completo de funciones desde una perspectiva general, Guía completa de Seedance 2.0 Reference es la lectura adecuada.
La multi-entrada es la forma en que el video con IA se vuelve preciso. Aprende el flujo de trabajo una vez y la calidad de tus generaciones mejora de forma permanente.
Prueba el stack multi-entrada completo
Sube imágenes, video y referencias de audio en una sola generación. Créditos gratuitos, sin tarjeta requerida.
Empieza a crear gratisPrueba Seedance 2.0 - ¡Ahora mismo!
5 generaciones gratis · Sin tarjeta de crédito