Comment créer des vidéos IA à partir de plusieurs images de référence
Neuf images, une seule génération. Voici exactement comment utiliser le mode de référence multi-images dans Seedance 2.0 pour obtenir des vidéos IA qui correspondent réellement à votre intention visuelle.

La plupart des modèles vidéo IA n'acceptent qu'une seule image. Seedance 2.0 Reference en accepte neuf. Ce n'est pas une petite différence : c'est la différence entre "partir d'un plan fixe" et "hériter d'un langage visuel complet."
Ce tutoriel couvre le workflow multi-images : combien de références utiliser, lesquelles choisir, comment elles fusionnent, et comment résoudre les problèmes quand le résultat ne correspond pas à ce que vous attendiez.
En résumé
- Seedance 2.0 Reference accepte jusqu'à 9 images par génération
- Plus d'images n'est pas toujours mieux : 4 à 6 références cohérentes surpassent souvent 9 références disparates
- Les 9 images fusionnent en un seul "vecteur de style" que le modèle applique au résultat
- Le coût est de 0,3024 dollar/sec quel que soit le nombre de références importées
- Essayez la génération multi-image gratuitement
Ce qui se passe quand vous importez 9 images
Le modèle ne traite pas vos 9 images comme des photogrammes séparés. Il les fusionne en une représentation stylistique unique, un résumé mathématique de leurs attributs visuels communs. Ce résumé guide le résultat.
Si vos 9 images partagent des attributs (lumière chaude, faible profondeur de champ, palette similaire), le vecteur fusionné est fort et précis. Le résultat s'ancre fermement dans ce style.
Si vos 9 images se contredisent (certaines chaudes, certaines froides, certaines larges, certaines serrées), le vecteur fusionné tend vers le générique et le style ne transperce presque pas.
La sélection compte plus que le nombre.
5 générations gratuites · Aucune carte de crédit requise
Combien de références utiliser concrètement
| Nombre | Quand l'utiliser |
|---|---|
| 1-2 | Plan principal unique, transfert de style minimal |
| 3-4 | Style clair avec peu de variation |
| 5-6 | Le juste milieu pour la plupart des projets |
| 7-9 | Style complexe avec plusieurs facettes |
La plage 5-6 est celle où la plupart des utilisateurs expérimentés se situent. C'est suffisamment varié pour capturer les différentes expressions d'un style sans diluer le signal avec des contradictions.
Montez plus haut uniquement quand vous avez genuinement plus de facettes à capturer, par exemple des plans intérieurs et extérieurs dans le même style cinématographique. Sinon, 5 à 6 images cohérentes surpasseront 9 images disparates à chaque fois.
Le cadre de sélection des références
Quand vous choisissez vos références, couvrez ces dimensions :
Palette de couleurs. 1 à 2 images qui montrent clairement votre étalonnage cible.
Direction de la lumière. 1 à 2 images montrant d'où vient la lumière (dure/douce, haute/basse, chaude/froide).
Composition et cadrage. 1 à 2 images montrant votre construction de plan préférée (symétrique, règle des tiers, serré/large).
Texture et grain. 1 image qui capture le rendu des détails fins (grain film, numérique propre, motif de bruit).
Traitement des sujets. 1 à 2 images montrant comment les sujets sont habituellement traités (isolés, fondus, en silhouette).
Si vous cochez chaque dimension, vous arriverez naturellement à 5 à 7 images. C'est l'objectif.

Constituez votre premier lot multi-images. Choisissez 5 à 6 images qui s'accordent sur le style et testez. Commencez gratuitement avec 10 crédits.
Un exemple de sélection soignée
Supposons que vous vouliez le look des films de Denis Villeneuve : poussiéreux, désaturé, épique, avec des températures de couleur spécifiques.
Mon lot :
- Plan désertique large tiré de Dune (échelle et palette)
- Gros plan d'un personnage dans une lumière poussiéreuse chaude (température de couleur)
- Plan intérieur de Blade Runner 2049 (palette désaturée, cadrage)
- Plan brumeux de Arrival (atmosphère et lumière douce)
- Scène nocturne de Sicario (dominante bleue froide, cadrage tendu)
- Un plan principal illustrant exactement l'ambiance recherchée
Six images. Toutes s'accordent sur l'esthétique Villeneuve. Le résultat tendra fortement vers ce look, quoi que je mette dans le prompt.
Associer le multi-images aux prompts
À retenir : les références gèrent le style. Les prompts gèrent le sujet et l'action.
Avec 6 références stylistiques solides, votre prompt doit décrire uniquement ce qui se passe :
Une silhouette en cape à capuche traverse une vaste plaine de sel au coucher du soleil,
le tissu fouetté par le vent, plan large en travelling, 8 secondes
Remarquez l'absence totale de langage stylistique. Pas de "cinématique", pas d'"épique", pas d'"atmosphérique". Les références disent déjà tout cela bien plus fort que les mots ne le pourraient.
Quand les références se combattent
Le problème multi-images le plus courant est la contradiction. Signes que vos références se battent :
- L'étalonnage du résultat est boueux/moyenné
- La lumière paraît générique plutôt que spécifique
- Le style semble "IA" malgré les références
- Deux clips avec les mêmes références produisent des looks notablement différents
Solution : retirez les 1 à 2 images aberrantes. Testez à nouveau. Si le problème persiste, vous avez probablement 2 groupes stylistiques incompatibles ou plus et vous devez en choisir un.
La démarche de débogage : générez un clip test avec les 9 images. Puis regénérez avec la moitié des images supprimées. Comparez. La version avec moins de références aura presque toujours un rendu plus affirmé.
Essayez Seedance 2.0 Reference, la génération vidéo multi-modale
9 images, 1 style fusionné, 1 vidéo bien définie. Crédits gratuits, sans carte bancaire.
Essayer Seedance 2.0 Reference gratuitementLe concept du plan de référence principal
Parmi vos références, désignez un "plan principal", l'image unique qui capture le mieux exactement l'ambiance souhaitée. Le modèle fusionne quand même toutes les références à égalité, mais le plan principal est votre étoile polaire. Si le résultat s'éloigne de l'atmosphère du plan principal, c'est qu'un autre élément de vos références dilue le signal.
Pensez au plan principal comme à la cible et aux autres références comme au contexte qui aide le modèle à la localiser. Sans plan principal, vous décrivez une direction sans destination.
Adapter du matériel source
La référence multi-images est exceptionnelle pour adapter du matériel source en vidéo.
Adapter une série photographique : importez 5 à 6 clichés de la série. Vos clips vidéo ressembleront à des prolongements de la série.
Adapter le style d'un film : récupérez 6 à 8 photogrammes d'un film précis. Votre génération donnera l'impression d'appartenir à ce film.
Adapter l'identité visuelle d'une marque : utilisez les meilleures images marketing de la marque comme références. Le résultat correspondra à l'esthétique de la marque sans que vous ayez besoin de la décrire.
Adapter du concept art : importez le concept art comme références. Le résultat animé ressemblera au concept art en mouvement.
Le coût ne varie pas selon le nombre d'images
Il vaut la peine de le répéter : vous payez pour la durée du rendu, pas pour le nombre d'images importées. 9 images coûtent autant qu'1 image. Le tarif de base est de 0,3024 dollar par seconde de vidéo générée :
| Durée | Crédits | Coût |
|---|---|---|
| 4 secondes | 19 | 1,90 dollar |
| 8 secondes | 37 | 3,70 dollars |
| 15 secondes | 69 | 6,90 dollars |
Alors en cas de doute, importez la référence supplémentaire. C'est gratuit et si elle améliore le vecteur fusionné, vous y gagnez.
Multi-images + référence de mouvement + référence audio
Vous pouvez combiner les trois types d'entrées dans une seule génération. Jusqu'à 9 images, jusqu'à 3 références de mouvement, jusqu'à 3 pistes audio. C'est là que Seedance 2.0 Reference se distingue vraiment de tous les autres modèles.
Exemple complet :
- 9 images définissant une esthétique Wes Anderson
- 1 vidéo de mouvement montrant un dolly lent et délibéré vers la gauche
- 1 clip audio d'un ensemble de cordes pincées
Plus un prompt minimal : Un concierge ouvre la porte d'un hôtel rose.
Le résultat ressemblera à 90% à un plan de Wes Anderson sans que vous ayez tapé "Wes Anderson" nulle part. Consultez notre guide multi-modal pour l'analyse approfondie.
Questions fréquentes
"Puis-je utiliser des références générées par IA ?" Oui. Les images fixes générées par Seedream fonctionnent très bien comme entrées de référence. Vous pouvez même générer des images fixes en premier, sélectionner les 6 meilleures, puis les utiliser comme références pour la vidéo.
"Les références doivent-elles avoir le même format que le rendu final ?" Non. Le modèle extrait le style indépendamment des dimensions.
"Puis-je réutiliser un lot de références d'un projet à l'autre ?" Absolument. Sauvegardez vos meilleurs ensembles de références et réutilisez-les quand des projets appellent ce style. Consultez tutoriel de cohérence de style pour savoir comment.
"Et si je n'ai qu'une seule image de référence ?" La référence multi-images fonctionne quand même avec 1 image, mais vous pourriez aussi envisager Seedance 2.0 standard qui accepte une seule image directement.
Votre première génération multi-images
Choisissez un style que vous aimez. Rassemblez 5 à 6 images qui le représentent (de n'importe quelle source : films, photographie, travaux existants, moodboards). Importez-les dans Seedance 2.0 Reference. Rédigez un prompt court décrivant uniquement le sujet et l'action. Générez sur 5 secondes.
Comparez le résultat à vos références. Si le style est bien ancré, vous avez un workflow reproductible. Sinon, resserrez votre lot et recommencez.
Dans dix minutes, vous saurez produire une vidéo IA qui ressemble vraiment à vos références plutôt que de ressembler à une "vidéo IA".
Importez 6 images, obtenez 1 vidéo assortie
Testez la référence multi-images avec votre propre moodboard. Crédits gratuits, sans carte bancaire.
Commencer à créer gratuitementEssayez Seedance 2.0 - Maintenant
5 générations gratuites · Aucune carte de crédit requise