Seedance 2.0 Reference: video de IA multimodal desde imágenes, vídeo y audio
Seedance 2.0 Reference es la única variante de Seedance que acepta hasta 9 imágenes, 3 vídeos y 3 clips de audio como referencias de estilo. Así es como cambia las reglas del juego para crear vídeos de IA consistentes.

Nueve imágenes. Tres vídeos. Tres clips de audio. Una generación de vídeo con IA. Esa es la propuesta única de Seedance 2.0 Reference, el único modelo de la línea Seedance que trata el estilo como un input de primera clase en lugar de un añadido secundario al prompt.
Si alguna vez has intentado mantener un aspecto coherente en un lote de vídeos generados con IA, sabes lo frustrante que puede ser. Los modelos estándar de texto a vídeo interpretan «cinemático», «oscuro» y «grano de película cálido» como un becario aburrido interpreta un briefing. Seedance 2.0 Reference se salta la interpretación y mira directamente el trabajo que quieres emular.
En resumen
- Acepta hasta 9 imágenes de referencia, 3 vídeos de referencia y 3 clips de audio por generación
- Precio: $0,3024 por segundo → 19-154 créditos ($1,90-$15,40) por clip
- Salida: 720p, duración de 4 a 15 segundos, sincronización de audio nativa incluida
- Tiempo de generación: 60-180 segundos según la duración del clip
- El único modelo de Seedance diseñado para la transferencia de estilo multimodal
- Pruébalo gratis con 10 créditos, sin necesidad de tarjeta en arteza.ai
Qué significa realmente «referencia multimodal»
La mayoría de los modelos de vídeo con IA aceptan una de dos cosas: un prompt, o un prompt más una imagen de inicio. Seedance 2.0 Reference acepta un moodboard completo de inputs y los trata como un briefing de estilo unificado.
Sube nueve fotogramas de una película cyberpunk y el modelo igualará la gradación de color, la sensación de objetivo y la iluminación de neón sobre asfalto mojado. Añade un clip corto con el movimiento de cámara exacto que quieres. Incluye una referencia de audio para el ambiente de la banda sonora. El modelo fusiona todo.
Esto importa porque el estilo es multidimensional. Un look «retro de los 80» no es una sola cosa: es grano, temperatura de color, destellos de objetivo, vibración del marco de película y composiciones específicas. Describir eso con palabras hace perder información. Mostrarlo con 9 imágenes no pierde casi ninguna.

¿Listo para igualar tu propio estilo visual? Seedance 2.0 Reference acepta tu moodboard completo en una sola generación. Pruébalo gratis con 10 créditos.
5 generaciones gratis · Sin tarjeta de crédito
Los inputs, explicados
Imágenes de referencia (hasta 9). El núcleo del modelo. Úsalas para fijar la paleta de color, el estilo de iluminación, la apariencia de los sujetos, las reglas de composición y la textura. Más referencias suelen significar una mayor fidelidad al estilo. Nueve es el límite porque, a partir de ahí, la fusión empieza a promediar tu intención.
Vídeos de referencia (hasta 3). Úsalos para las señales de movimiento: movimientos de cámara, ritmo, momentos de acción. El modelo extrae vectores de movimiento de las referencias y los combina en el resultado. Una referencia en mano más una referencia con travelling te dará algo intermedio.
Audio de referencia (hasta 3). Importa menos el sonido en sí y más el estado de ánimo que implica. Las referencias ambientales guían la atmósfera visual: una pista de audio tormentosa empujará la generación hacia imágenes más tormentosas aunque no hayas especificado el clima.
Prompt de texto. Sigue siendo obligatorio. Las referencias le dicen al modelo cómo; el prompt le dice qué.
Cómo se compara con Seedance 2.0 estándar
El Seedance 2.0 estándar es un modelo de texto a vídeo e imagen a vídeo de uso general. Acepta un prompt y opcionalmente una imagen. Eso es todo. La variante Reference es el mismo modelo base con una superficie de entrada drásticamente ampliada.
| Característica | Seedance 2.0 | Seedance 2.0 Reference |
|---|---|---|
| Prompt de texto | Sí | Sí |
| Input de imagen | 1 imagen | Hasta 9 imágenes |
| Referencia de vídeo | No | Hasta 3 vídeos |
| Referencia de audio | No | Hasta 3 clips de audio |
| Coste por segundo | $0.3034 | $0.3024 |
| Ideal para | Generación rápida desde un prompt | Series con estilo coherente, vídeos de marca, lookbooks |
El precio por segundo es casi idéntico. Lo que cambia es lo que puedes darle al modelo, y lo que eso desbloquea.
Precio: lo que pagarás realmente
Seedance 2.0 Reference factura aproximadamente 2,9 créditos por segundo de salida. Eso se desglosa de forma clara:
| Duración | Créditos | USD |
|---|---|---|
| 4 segundos | 19 | $1.90 |
| 5 segundos | 23 | $2.30 |
| 8 segundos | 37 | $3.70 |
| 10 segundos | 46 | $4.60 |
| 15 segundos | 69 | $6.90 |
Las referencias son gratuitas. Pagas por la duración del resultado, no por el número de inputs. Nueve imágenes cuestan lo mismo que una.
Las cuentas nuevas reciben 10 créditos gratis al registrarse, sin tarjeta ni contrato anual. Es suficiente para ejecutar tu primera prueba en modo referencia. A partir de ahí, eliges el plan mensual que mejor se adapte:
| Plan | Precio | Créditos mensuales |
|---|---|---|
| Starter | $5 | 60 |
| Creator | $25 | 300 |
| Pro | $50 | 700 |
| Studio | $120 | 1.800 |
Consulta el desglose completo en precios.
Prueba Seedance 2.0 Reference: generación de vídeo multimodal
Iguala tu estilo visual con hasta 9 imágenes de referencia. Créditos gratis, sin necesidad de tarjeta.
Prueba Seedance 2.0 Reference gratisDónde el modo Reference demuestra su valor
Vídeos de marca. Sube tu fotografía de producto, tus creatividades publicitarias existentes y los colores de tu marca. El resultado coincide con tu identidad visual sin que tengas que describirla.
Series de vídeo con estilo coherente. ¿Grabando una secuencia de 10 partes? Usa el mismo paquete de referencias en cada generación y las piezas parecerán surgidas de una misma sesión.
Lookbooks y moda. El modo Reference es excepcional para igualar un estilo fotográfico, con iluminación de estudio, compresión de objetivo y color de vestuario, en múltiples modelos y poses.
De storyboard a vídeo. Dale al modelo tu arte conceptual y obtén versiones en movimiento con el mismo estilo. Sin más compromisos de «suficientemente parecido».
Pre-visualización de videoclips. Referencias de audio más referencias visuales más un prompt equivalen a un corte aproximado que refleja realmente el ambiente de la canción.
El resultado: qué obtienes
Cada generación de Seedance 2.0 Reference produce:
- Vídeo a 720p a 24 fps
- De 4 a 15 segundos de duración (a tu elección)
- Sincronización de audio nativa: audio ambiente generado para coincidir con la escena
- Tres relaciones de aspecto: 16:9, 9:16, 1:1
- Entrega en 60 a 180 segundos según la duración
El audio nativo merece destacarse. Incluso sin referencias de audio, obtienes ambience al estilo foley incluido. Con referencias de audio, obtienes un ambiente que coincide con tu señal de estado de ánimo.
Prompt y referencia: el flujo de trabajo híbrido
El error que comete la gente es apoyarse totalmente en las referencias y escribir un prompt descuidado. Las referencias gestionan el estilo. El prompt sigue teniendo que hacer el trabajo pesado en cuanto a sujeto, acción y composición.
Un buen prompt híbrido tiene este aspecto:
Una mujer con un trench rojo caminando por un callejón de Tokio empapado
de lluvia de noche, señales de neón reflejadas en los charcos, travelling lento
hacia adelante, sensación de cámara en mano, cinemático
Con 6 imágenes de referencia cyberpunk adjuntas, el modelo sabe qué significa «cinemático» para esta sesión. No tiene que adivinarlo.
Cómo encaja Seedance 2.0 Reference en la línea de ByteDance
Si has estado siguiendo los lanzamientos de vídeo con IA de ByteDance, sabrás que ahora hay toda una familia: Seedance 1.0 Pro, Seedance 2.0, Seedream para imágenes fijas y la línea de avatares OmniHuman.
Seedance 2.0 Reference es la pieza más reciente y la más especializada. No está pensado para reemplazar a Seedance 2.0 estándar: para clips puntuales a partir de un prompt, el estándar es más rápido y económico para iterar. El modo Reference es para cuando necesitas que tu resultado coincida con algo.
Cómo empezar en menos de cinco minutos
- Ve a arteza.ai/create/seedance-2-reference
- Inicia sesión (los 10 créditos gratis se aplican automáticamente)
- Sube entre 3 y 9 imágenes de referencia que representen tu estilo objetivo
- Opcionalmente añade entre 1 y 3 vídeos de referencia para el movimiento y entre 1 y 3 clips de audio para el ambiente
- Escribe tu prompt describiendo el sujeto y la acción
- Elige una duración (5 segundos es una buena primera prueba)
- Genera
Tu primer clip se descarga en unos 90 segundos.
Las limitaciones reales
El modo Reference no es magia. Si tus 9 referencias se contradicen entre sí, la mitad de terror oscuro y la mitad de comedia luminosa, el modelo las promediará y obtendrás algo soso. Selecciona con criterio.
Tampoco puede generar diálogos originales ni música. La sincronización de audio es ambiente y foley. Para cabezas parlantes con sincronización labial, mejor usa OmniHuman.
Y aunque el modelo es potente en la transferencia de estilo, no es una herramienta perfecta de intercambio de rostros. Usar imágenes de referencia de una persona concreta capturará su aspecto general, pero no su semejanza exacta. Eso es una ventaja, no un defecto.
Próximos pasos
Si quieres el tutorial práctico para tu primera generación, lee nuestro guía de video con estilo consistente. Si estás decidiendo entre variantes, la comparativa Reference vs Standard lo desglosa todo. Y si vienes de otra plataforma, el artículo Reference vs Runway cubre el proceso de cambio.
Seedance 2.0 Reference es el primer modelo de vídeo con IA que trata tu estilo visual como un input en lugar de una interpretación. Pruébalo con tus propias referencias y descubre lo que ocurre.
Tu moodboard, tu vídeo
Sube hasta 9 imágenes, 3 vídeos y 3 clips de audio. Obtén un vídeo con IA que los iguala en menos de 3 minutos.
Empieza a crear gratisPrueba Seedance 2.0 - ¡Ahora mismo!
5 generaciones gratis · Sin tarjeta de crédito