Génération vidéo IA multi-entrées : Guide complet
La génération vidéo IA multi-entrées signifie alimenter le modèle avec bien plus que du texte. Voici le guide complet pour utiliser les entrées d'images, vidéo et audio dans Seedance 2.0 Reference.

La prochaine phase de la vidéo IA, ce n'est pas des meilleurs prompts - c'est de meilleures entrées. Pendant deux ans, l'industrie a optimisé un seul levier : le prompt textuel. Ce levier arrive à saturation. Le vrai progrès réside dans l'acceptation d'entrées plus riches : images, clips vidéo, audio, et combinaisons des trois.
Seedance 2.0 Reference est le modèle de vidéo IA multi-entrée le plus complet actuellement disponible, et ceci est le guide complet pour utiliser chaque type d'entrée ensemble.
TL;DR
- Multi-entrée = texte + jusqu'à 9 images + jusqu'à 3 clips vidéo + jusqu'à 3 clips audio
- Chaque type d'entrée contrôle différentes dimensions de sortie (style, mouvement, ambiance)
- Tout fusionné en une seule génération à 0,3024 $ par seconde
- Temps de génération : 60-180 secondes indépendamment du nombre d'entrées
- Le workflow le plus efficace pour une sortie vidéo IA précise
- Essayez la pile multi-entrée complète gratuitement
Pourquoi la multi-entrée est importante
Le texte est l'information visuelle compressée. Quand vous écrivez « sombre, chaud, cinématique », vous prenez un concept visuel riche et vous le compressez de manière irréversible en sept syllabes. Le modèle doit ré-élargir ces sept syllabes en images, et cette ré-expansion perd de l'information.
La multi-entrée saute l'étape de compression. Au lieu de décrire votre style en mots, vous le montrez directement. Au lieu de décrire le mouvement, vous le montrez. Au lieu de décrire l'ambiance, vous le montrez. Le modèle lit vos entrées en fidélité complète.
Le résultat est une sortie qui répond à l'intention de manière plus précise, dès la première génération, sans autant d'itération de prompt.
5 générations gratuites · Aucune carte de crédit requise
Les quatre types d'entrée
1. Prompt textuel (obligatoire). La seule chose que le texte devrait faire dans un workflow multi-entrée : décrire le sujet et l'action. Laissez le style, l'ambiance et le mouvement aux autres entrées.
2. Images de référence (jusqu'à 9). Entrée de style principal. Couvrez la couleur, l'éclairage, la composition, le grain, la texture.
3. Vidéos de référence (jusqu'à 3). Entrée de mouvement. Capturez les mouvements de caméra, le rythme, le rythme d'action.
4. Audio de référence (jusqu'à 3). Entrée d'ambiance. Biaise la sortie visuelle émotionnellement, pas par la piste audio réelle de la sortie.
Ensemble, ceux-ci vous donnent le contrôle sur chaque dimension de la sortie sans compter sur le texte pour tout faire.
Comment fonctionne la fusion
Sous le capot, Seedance 2.0 Reference traite chaque type d'entrée via des encodeurs dédiés et fusionne les résultats en un seul signal de conditionnement. Le prompt textuel passe par un encodeur de texte ; les images passent par un encodeur d'image ; la vidéo passe par un encodeur de mouvement ; l'audio passe par un encodeur d'ambiance audio.
Le signal de conditionnement fusionné est ensuite utilisé pour guider le processus de génération vidéo. Vous ne voyez rien de tout cela - vous voyez juste les entrées entrer et la vidéo sortir. Mais comprendre la fusion vous aide à réfléchir sur les entrées à peser plus lourdement.
Ordre de pondération approximatif:
- Texte : influence forte sur le sujet et l'action
- Images : influence forte sur le style visuel
- Vidéo : influence forte sur le mouvement
- Audio : influence subtile sur l'ambiance visuelle
Il manque un type d'entrée ne casse pas la génération. Cela laisse juste cette dimension au comportement par défaut, ce qui est souvent bien pour le travail plus simple.

Lancez votre première génération multi-entrée. Téléchargez les trois types d'entrée et voyez la précision. Commencer gratuitement.
Un exemple complet multi-entrée
Voici une génération avec chaque type d'entrée utilisé.
Prompt textuel:
Une femme dans une veste en cuir est assise sur une moto dans une
ruelle éclairée au néon la nuit, la caméra pousse lentement, 8 secondes
Images de référence (7):
- 3 images fixes de Blade Runner (couleur, éclairage)
- 2 photos de cyberpunk (composition, grain)
- 1 photo produit moto (positionnement du sujet)
- 1 frame héroïque (cible d'ambiance générale)
Référence vidéo (1):
- Clip de 3 secondes d'un dolly lent poussant vers un sujet
Référence audio (1):
- Clip de 5 secondes d'un drone synthétique avec pluie subtile
Résultat:
- Style : Fortement Blade Runner, verrouillé par les images
- Mouvement : Correspond précisément à la référence dolly push
- Ambiance : Atmosphère subtile imbibée de pluie à partir du signal audio
Total des entrées : 7 images + 1 vidéo + 1 audio + 1 prompt. Temps de génération : ~120 secondes. Sortie : exactement ce que je voulais dès le premier essai.
Comparez cela aux workflows texte seul où il faut souvent 5-10 générations pour se rapprocher du look prévu. La multi-entrée vous épargne le coût d'itération et correspond à l'intention plus précisément.
Quand ajouter chaque type d'entrée
Vous n'avez pas toujours besoin des quatre. Voici quand chacun ajoute de la valeur.
Texte seul: Jamais. Vous avez toujours besoin d'au moins un type de référence pour le mode Reference.
Texte + images: Configuration la plus courante. Fonctionne pour 70% des projets.
Texte + images + vidéo: Quand vous avez besoin d'un mouvement spécifique qui est difficile à décrire.
Texte + images + audio: Quand l'ambiance doit changer au-delà de ce que les images seules peuvent capturer.
Les quatre: Quand la précision maximale est importante - travail de marque, shots héroïques, livrables finaux.
Commencez avec texte + images et ajoutez d'autres entrées au fur et à mesure que vous atteignez les limites de cette configuration.
Workflows multi-entrée pour différents cas d'usage
Pour les vidéos de marque: Texte + 6-9 images de marque + 1-2 références de mouvement montrant votre style de caméra signature. Ignorez les références audio sauf si vous avez une cible d'ambiance spécifique.
Pour les clips musicaux: Texte + 6-9 images de style + 1 référence audio correspondant à l'ambiance de la chanson. Les références vidéo sont optionnelles.
Pour les storyboards: Texte + 4-6 images de concept art + 1 référence de mouvement par type de shot. Ignorez l'audio.
Pour les lancements de produit: Texte + 5-7 photos produit + 1 référence de mouvement lifestyle/marque. Ignorez l'audio à moins que le produit n'ait des associations d'ambiance.
Pour l'édition/mode: Texte + 6-9 photos de lookbook + 1 référence de mouvement marche/pose. Ignorez l'audio sauf si la séance a une bande sonore accompagnante.
Essayez Seedance 2.0 Reference - génération vidéo multi-modale
Contrôle multi-entrée complet : images, vidéo et références audio en un seul appel. 50 crédits gratuits, sans carte requise.
Essayez Seedance 2.0 Reference GratuitementConsidérations de coût et de vitesse
Les générations multi-entrée coûtent le même prix par seconde que les générations à entrée unique : 0,3024 $ par seconde de sortie. Ajouter des types de référence n'ajoute pas de coût.
| Durée | Crédits | Coût |
|---|---|---|
| 4 sec | 243 | 2,42 $ |
| 8 sec | 484 | 4,84 $ |
| 15 sec | 907 | 9,07 $ |
Vitesse: Les générations multi-entrée prennent légèrement plus de temps que les générations texte seul car le modèle traite plus de données d'entrée. Attendez-vous à 90-180 secondes pour les appels multi-entrée par rapport à 60-120 pour les appels image uniquement. L'attente supplémentaire vaut presque toujours le gain de précision.
Erreurs courantes multi-entrée
Entrées contradictoires. Si vos images disent « sombre et lent » et votre audio dit « dynamique et rapide », la fusion devient confuse. Choisissez des entrées qui s'accordent sur l'ambiance.
Utiliser les références vidéo pour le style. Les références vidéo influencent uniquement le mouvement, pas le style. Ne les choisissez pas en fonction de leur apparence visuelle.
Surcharger l'audio. Une ou deux références audio sont généralement suffisantes. Trois peuvent diluer le signal d'ambiance.
Ignorer le prompt. Même avec des références fortes, vous avez besoin d'un prompt textuel pour le sujet et l'action. Un prompt vide produira du contenu générique.
Changer les entrées entre les clips d'une série. Si vous produisez plusieurs clips qui doivent se sentir liés, utilisez des lots de référence identiques pour tous.
Comparaison multi-entrée avec entrée unique
Voici une comparaison côte à côte que j'ai menée avec le même scénario.
Scénario: Court clip atmosphérique d'une rue de ville imbibée de pluie la nuit.
Tentative texte seul:
Shot atmosphérique d'une rue de ville imbibée de pluie la nuit, reflets au néon,
éclairage cinématique sombre, lente poussée de caméra, 5 secondes
Résultat: Decent mais générique. Pourrait être n'importe quel clip IA de style noir. L'ai obtenu à la 4e génération après itération sur le prompt.
Tentative multi-entrée:
- Même prompt sans langage de style
- 6 images fixes de Blade Runner
- 1 référence vidéo dolly push
- 1 référence audio synthétique pluvieuse
Résultat: Spécifique, verrouillé, a correspond à mon ambiance prévue au premier essai.
Économie de temps : ~8 minutes d'itération éliminées. Économie de coût : 3 tentatives de génération en moins à ~3 $ chacune = ~9 $ économisés.
Multipliez cela sur un projet avec 20+ clips et les workflows multi-entrée se payent plusieurs fois.
Multi-entrée vs Seedance 2.0 Standard
À noter : Seedance 2.0 standard est un workhorse texte vers vidéo / image vers vidéo. C'est entrée unique. Si vous avez besoin seulement d'un prompt et d'une image, standard est plus rapide à configurer.
Multi-entrée avec Seedance 2.0 Reference est pour quand la précision compte plus que la vitesse de configuration. Voir le Comparaison Reference vs Standard complet pour le cadre de décision.
Conseils de préparation d'entrée
Images: 512px+ sur le petit côté, JPG ou PNG, idéalement d'une source de style cohérente.
Vidéo: 2-5 secondes par clip, tout rapport d'aspect, MP4 préféré.
Audio: 4-10 secondes par clip, MP3 ou WAV, correspondant à votre ambiance cible.
Ne surengénérez pas la préparation d'entrée. Le modèle est assez indulgent sur la résolution, le format et la taille du fichier. Ce qui compte est la pertinence du contenu, pas la perfection technique.
Construire une bibliothèque multi-entrée
Les utilisateurs expérimentés construisent une bibliothèque personnelle d'entrées réutilisables:
- Ensembles de style pour différents genres/ambiances (noir, pastoral, épique, etc.)
- Clips de mouvement pour les mouvements de caméra courants (dolly in, main libre, static hold, etc.)
- Signaux audio pour les tons émotionnels (mélancolique, plein d'espoir, tendu, etc.)
Avec une bibliothèque, démarrer un nouveau projet est une question de combiner les entrées existantes plutôt que de sourcer tout à nouveau. Vous développez une « sonorité » - un style reconnaissable qui porte à travers votre travail car vos entrées sont cohérentes.
Aller plus loin
Pour une plongée pratique profonde sur la combinaison multi-modale, lisez vidéo IA multi-modal. Pour le workflow spécifique à l'image, consultez le tutoriel multi-image. Pour la vue d'ensemble du breakdown des fonctionnalités, le Guide complet de Seedance 2.0 Reference est la bonne lecture.
La multi-entrée est comment la vidéo IA devient précise. Apprenez le workflow une fois et votre qualité de génération augmente définitivement.
Essayez la pile multi-entrée complète
Téléchargez les références image, vidéo et audio en une génération. 50 crédits gratuits, sans carte requise.
Commencez à Créer GratuitementTry Seedance 2.0 - Right Now
5 free generations · No credit card needed