Comment créer des vidéos IA à partir de plusieurs images de référence
Neuf images, une génération. Voici exactement comment utiliser le mode de référence multi-images dans Seedance 2.0 pour obtenir des vidéos IA qui correspondent vraiment à votre intention visuelle.

La plupart des modèles vidéo IA utilisent une seule image. Seedance 2.0 Reference en utilise neuf. Ce n'est pas une petite différence - c'est la différence entre "partir d'une image fixe" et "hériter d'un langage visuel complet."
Ce tutoriel couvre le workflow multi-images : combien de références utiliser, lesquelles choisir, comment elles fusionnent, et comment résoudre les problèmes lorsque le résultat ne correspond pas à ce que vous attendiez.
TL;DR
- Seedance 2.0 Reference accepte jusqu'à 9 images par génération
- Plus d'images n'est pas toujours mieux - 4-6 références ciblées surpassent souvent 9 références vagues
- Les 9 images sont fusionnées en un seul "vecteur de style" que le modèle applique à la sortie
- Le coût est de 0,3024 dollars/sec quel que soit le nombre de références que vous téléchargez
- Essayez la génération multi-image gratuitement
Ce qui se passe quand vous téléchargez 9 images
Le modèle ne traite pas vos 9 images comme des images distinctes. Il les fusionne en une seule représentation de style - un résumé mathématique de leurs attributs visuels partagés. Ce résumé guide la sortie.
Si vos 9 images partagent des attributs (lumière chaude, profondeur de champ peu profonde, palette similaire), le vecteur fusionné est puissant et spécifique. La sortie s'accroche à ce style.
Si vos 9 images sont contradictoires (certaines chaudes, certaines froides, certaines larges, certaines serrées), le vecteur fusionné se normalise vers du générique et le style passe à peine.
La curation importe plus que la quantité.
5 générations gratuites · Aucune carte de crédit requise
Combien de références utiliser réellement
| Nombre | Quand l'utiliser |
|---|---|
| 1-2 | Image héroïque unique, transfert de style minimal |
| 3-4 | Style clair avec variation minimale |
| 5-6 | Point optimal pour la plupart des projets |
| 7-9 | Style complexe avec plusieurs facettes |
La gamme 5-6 est où se retrouvent la plupart des utilisateurs expérimentés. C'est assez de variété pour capturer les différentes expressions d'un style sans diluer le signal avec des contradictions.
Allez plus haut seulement si vous avez réellement plus de facettes à capturer - des images d'intérieurs et d'extérieurs dans le même style de film, par exemple. Sinon, 5-6 images ciblées surpasseront chaque fois 9 images vagues.
Le cadre de sélection des références
Quand vous choisissez des références, couvrez ces dimensions :
Palette de couleurs. 1-2 images qui montrent clairement votre étalonnage des couleurs cible.
Direction de l'éclairage. 1-2 images montrant d'où provient la lumière (dur/doux, haut/bas, chaud/froid).
Composition et cadrage. 1-2 images montrant votre construction de plan préférée (symétrique, règle des tiers, serré/large).
Texture et grain. 1 image qui capture la sensation de détail fin (grain de film, numérique net, motif de bruit).
Traitement du sujet. 1-2 images montrant comment les sujets sont habituellement traités (isolés, mélangés, silhouettés).
Si vous cochez chaque dimension, vous atterrirez naturellement à 5-7 images. C'est la cible.

Créez votre premier ensemble multi-images. Choisissez 5-6 images qui s'accordent sur le style et testez. Commencez gratuitement avec 50 crédits.
Un exemple conservé
Supposons que vous vouliez le look des films de Denis Villeneuve - poussiéreux, muted, à grande échelle épique, températures de couleur spécifiques.
Mon ensemble :
- Plan large du désert de Dune (échelle et palette)
- Gros plan d'un personnage dans une lumière chaude poussiéreuse (température de couleur)
- Plan d'intérieur de Blade Runner 2049 (palette muted, cadrage)
- Plan de brouillard d'Arrival (atmosphère et lumière douce)
- Scène de nuit de Sicario (biais bleu cool, cadrage de tension)
- Un cadre héroïque montrant exactement la sensation que je poursuis
Six images. Toutes s'accordent sur l'esthétique Villeneuve. La sortie penchera fortement vers ce look quel que soit ce que je mets dans le prompt.
Associer multi-images avec des prompts
Souvenez-vous : les références gèrent le style. Les prompts gèrent le sujet et l'action.
Avec 6 références de style fortes, votre prompt doit être purement descriptif de ce qui se passe :
Une figure dans une cape à capuche traverse un vaste lac de sel au coucher du soleil,
le vent fouettant le tissu, plan de suivi large, 8 secondes
Remarquez qu'il n'y a zéro langage de style. Pas de "cinématique", pas d'"épique", pas d'"atmosphérique". Les références disent déjà tout cela plus fort que les mots ne le pourraient.
Quand les références se battent entre elles
Le problème multi-images le plus courant est la contradiction. Signes que vos références se battent :
- L'étalonnage des couleurs de sortie est boueux/moyenné
- L'éclairage semble générique au lieu d'être spécifique
- Le style semble "IA-ish" malgré les références
- Deux clips avec les mêmes références produisent des looks notablement différents
Correction : supprimez les 1-2 images aberrantes. Testez à nouveau. Si le problème persiste, vous avez probablement 2+ groupes de style incompatibles et devez vous engager envers l'un.
Le processus de débogage : générez un clip de test avec les 9 images. Puis générez à nouveau avec la moitié des images supprimées. Comparez. La version avec moins de références aura presque toujours l'air plus décisive.
Essayez Seedance 2.0 Reference - génération vidéo multi-modale
9 images, 1 style fusionné, 1 vidéo verrouillée. 50 crédits gratuits, pas de carte requise.
Essayez Seedance 2.0 Reference GratuitementLe concept du cadre héroïque
Parmi vos références, désignez un "cadre héroïque" - l'image unique qui capture le mieux exactement la sensation que vous voulez. Le modèle fusionne toujours toutes les références également, mais le cadre héroïque est votre vrai nord. Si la sortie dévie de la sensation du cadre héroïque, vous savez que quelque chose dans les autres références dilue le signal.
Pensez au cadre héroïque comme la cible et aux autres références comme contexte qui aide le modèle à le triangler. Sans le cadre héroïque, vous décrivez une direction sans destination.
Correspondance avec le matériel source
La référence multi-images est exceptionnelle pour adapter le matériel source à la vidéo.
Adapter une série de photos : Donnez au modèle 5-6 images de la série. Vos clips vidéo auront l'air de continuations de la série.
Adapter le style d'un film : Prenez 6-8 images d'un film spécifique. Votre génération aura l'air d'appartenir à ce film.
Adapter l'identité visuelle d'une marque : Utilisez les meilleures images marketing de la marque comme références. La sortie correspondra à l'esthétique de la marque sans que vous ayez besoin de la décrire.
Adapter de l'art conceptuel : Téléchargez l'art conceptuel comme références. La sortie animée aura l'air du concept art en mouvement.
Le coût n'évolue pas avec le nombre d'images
Vaut la peine de répéter : vous payez pour la durée de sortie, pas le nombre d'entrées. 9 images coûtent le même prix que 1 image. Le taux de base est de 0,3024 dollars par seconde de vidéo générée :
| Durée | Crédits | Coût |
|---|---|---|
| 4 secondes | 243 | 2,42 dollars |
| 8 secondes | 484 | 4,84 dollars |
| 15 secondes | 907 | 9,07 dollars |
Donc en cas de doute, téléchargez la référence supplémentaire. C'est gratuit et si cela aide le vecteur fusionné, vous gagnez.
Multi-images + Référence de mouvement + Référence audio
Vous pouvez combiner les trois types d'entrées dans une seule génération. Jusqu'à 9 images, jusqu'à 3 références de mouvement, jusqu'à 3 indices audio. C'est là que Seedance 2.0 Reference se distingue vraiment de tous les autres modèles.
Exemple de pile complète :
- 9 images définissant une esthétique Wes Anderson
- 1 vidéo de mouvement montrant un dolly lent et délibéré vers la gauche
- 1 clip audio d'une section de cordes entraînante
Plus un prompt minimal : Un concierge ouvre la porte d'un hôtel rose.
La sortie ressemblera à 90% à un plan Wes Anderson sans que vous ayez besoin de taper "Wes Anderson" n'importe où. Consultez notre guide multi-modal pour le plongeon en profondeur.
Questions courantes
"Puis-je utiliser des références générées par IA ?" Oui. Seedream les images fixes fonctionnent très bien comme entrée de référence. Vous pouvez même générer d'abord des images fixes, curer les meilleures 6, puis les utiliser comme références pour la vidéo.
"Les références doivent-elles avoir le même rapport d'aspect que la sortie ?" Non. Le modèle extrait le style indépendamment des dimensions.
"Puis-je réutiliser un ensemble sur plusieurs projets ?" Absolument. Enregistrez vos meilleurs ensembles de références et réutilisez-les quand les projets demandent ce style. Consultez le tutoriel de cohérence de style pour savoir comment.
"Et si je n'ai que 1 image de référence ?" La référence multi-images fonctionne toujours avec 1 image, mais vous pourriez aussi envisager Standard Seedance 2.0 qui accepte une seule image directement.
Votre première génération multi-images
Choisissez un style que vous aimez. Rassemblez 5-6 images qui le représentent (de n'importe où - films, photographie, travaux existants, tableaux d'inspiration). Téléchargez-les à Seedance 2.0 Reference. Écrivez un court prompt décrivant uniquement le sujet et l'action. Générez à 5 secondes.
Comparez la sortie à vos références. Si le style s'est verrouillé, vous avez un workflow répétable. Si ce n'est pas le cas, resserrez votre ensemble et réessayez.
Dans dix minutes, vous saurez comment produire une vidéo IA qui ressemble réellement à vos références au lieu de ressembler à une "vidéo IA".
Téléchargez 6 images, obtenez 1 vidéo correspondante
Testez la référence multi-images avec votre propre tableau d'inspiration. 50 crédits gratuits, pas de carte requise.
Commencez à créer gratuitementTry Seedance 2.0 - Right Now
5 free generations · No credit card needed