Vidéo IA multi-modale: combinez images, vidéo et audio avec Arteza
La vraie vidéo IA multi-modale signifie fournir au modèle bien plus qu'une simple invite. Voici comment combiner des références d'images, de vidéo et d'audio dans Seedance 2.0 Reference.

« Multi-modal » est un terme utilisé à tort et à travers dans le marketing de l'IA. La plupart des outils qui le revendiquent signifient en réalité « nous acceptons du texte et une image ». Seedance 2.0 Reference est l'un des rares modèles qui prend le terme au sérieux : jusqu'à 9 images, 3 clips vidéo et 3 clips audio, tous fusionnés dans une seule génération.
Voici comment utiliser réellement ces trois types d'entrée ensemble, et pourquoi cette combinaison déverrouille des possibilités qu'aucune entrée simple ne peut offrir.
TL;DR
- Seedance 2.0 Reference accepte images + vidéo + audio en tant que références dans un seul appel
- Les images contrôlent le style, la vidéo contrôle le mouvement, l'audio contrôle l'ambiance
- Combiner les trois produit une sortie plus serrée que n'importe quel type d'entrée unique
- Tarification : 0,3024 $/sec, indépendamment du nombre de références utilisées
- Génération : 60-180 secondes pour le pipeline multi-modal fusionné
- Essayez la pile multi-modale complète gratuitement
Ce que chaque type d'entrée contrôle réellement
Ces trois types de références ne se chevauchent pas - ils gèrent différentes dimensions de la sortie.
Les images contrôlent le style. Palette de couleurs, éclairage, composition, texture, cadrage. Tout ce qui est visuel et n'implique pas de mouvement.
La vidéo contrôle le mouvement. Mouvements de caméra, rythme, vecteurs d'action, rythme temporel. Pas la couleur ou l'éclairage - le modèle extrait le mouvement indépendamment du style visuel de la vidéo.
L'audio contrôle l'ambiance. Biais émotionnel qui incline subtilement la sortie visuelle. Ce n'est pas le son que vous entendez dans la sortie (il est généré séparément), mais l'indice d'ambiance qui influence ce qui s'affiche à l'écran.
Quand vous utilisez les trois ensemble, chacun comble une lacune que les autres ne peuvent pas remplir.
5 générations gratuites · Aucune carte de crédit requise
La pile en action
Voici une génération multi-modal concrète que j'ai exécutée.
Objectif : Un plan au ralenti onirique d'une femme courant dans un champ à l'aube, dans le style d'un film de Terrence Malick.
Références d'images (6) :
- 2 arrêts de film Malick montrant une lumière d'aube chaleureuse
- 2 images de champs à l'heure dorée
- 1 plan du caractère exact de l'objectif que je voulais (bokeh doux et onirique)
- 1 cadre héros montrant l'ambiance précise
Références vidéo (1) :
- Un clip de 3 secondes d'une figure en train de courir au ralenti photographié avec un objectif long
Références audio (1) :
- 4 secondes de piano doux et épars
Invite :
Une femme en robe blanche court dans l'herbe haute à l'aube, 8 secondes
Remarquez à quel point l'invite est minimaliste. Les références gèrent tout le reste.
La sortie était étonnamment proche de l'intention - le style provenant des images, la sensation spécifique de course au ralenti provenant de la vidéo, et un poids émotionnel subtil provenant de l'audio que je n'aurais pas pu obtenir avec seulement des images.

Essayez la pile multi-modal complète. Téléchargez des images, un clip de mouvement et une référence audio en un seul coup. Commencez gratuitement avec 50 crédits.
Références d'images : la fondation
Les images sont l'entrée la plus lourdement pondérée dans la fusion. Elles doivent toujours être votre canal de style principal. Utilisez 4 à 6 au minimum, jusqu'à 9 pour les styles complexes.
Consultez le tutoriel multi-image dédié pour la méthodologie complète de curation d'images. Résumé : l'accord importe plus que le nombre, couvrir différentes facettes du style, inclure un cadre héros.
Références vidéo : la couche de mouvement
Les références vidéo sont là où le multi-modal se distingue vraiment des flux basés uniquement sur les images. Décrire le mouvement de la caméra par des mots est genuinely difficile - « une dérive lente et instable vers la gauche en levant subtilement vers le haut » perd de la fidélité chaque fois que vous la traduisez en prose.
Une référence vidéo de 2-5 secondes saute la traduction. Le modèle échantillonne les vecteurs de mouvement directement.
Meilleurs usages :
- Style instable spécifique que vous voulez correspondre
- Mouvements de caméra délicats (craning, combos dolly + pan, transitions par coup de fouet)
- Indices de rythme (sensation de coupes rapides vs sentiment contemplatif lent)
- Rythme d'action pour contenu sportif ou danse
Ce que les références vidéo ne font pas :
- Elles ne transportent pas leur propre style. L'étalonnage des couleurs de la référence ne se transfèrera pas - seulement le mouvement.
- Elles ne dictent pas le contenu. Le sujet dans la référence n'apparaît pas dans votre sortie.
Vous pouvez utiliser jusqu'à 3 références vidéo par génération. Empiler plusieurs références de mouvement les mélange - utile pour obtenir « entre » deux mouvements de référence.
Références audio : la couche d'ambiance
Les références audio sont les plus étranges des trois. Elles n'apparaissent pas dans la piste audio de votre sortie (elle est générée fraîchement pour correspondre à la scène). Au lieu de cela, elles nudgent les visuels émotionnellement.
Une référence audio orageuse penche vers un éclairage dramatique et une palette plus sombre. Une référence énergique et joyeuse penche vers un cadrage plus lumineux et plus de mouvement. Une référence mélancolique et épars penche vers des plans plus longs et plus lents avec des tons plus froids.
Quand les utiliser :
- Les références de style et l'invite sont solides mais la sortie se sent émotionnellement plate
- Vous voulez une ambiance difficile à décrire visuellement
- Vous faites correspondre la sortie à une partition existante ou une chanson
Quand les ignorer :
- Vos premières générations. Commencez avec les images seules. Ajoutez des références audio une fois que vous êtes à l'aise avec la baseline.
Jusqu'à 3 références audio par génération, fusionnées ensemble.
Essayez Seedance 2.0 Reference - génération vidéo multi-modal
Combinez des références d'images, vidéo et audio en une seule génération. 50 crédits gratuits, sans carte requise.
Essayez Seedance 2.0 Reference gratuitementL'arbre de décision multi-modal
Pas tous les projets nécessitent les trois entrées. Voici quand ajouter chacun :
Toujours : Références d'images (3+ minimum) Ajouter une référence vidéo si : Vous avez besoin d'un mouvement spécifique difficile à décrire Ajouter une référence audio si : Votre sortie se sent émotionnellement décalée après des tentatives images uniquement
Ne forcez pas le multi-modal quand une pile plus simple fonctionne. Les générations images uniquement sont plus rapides à configurer et souvent suffisantes.
Erreurs courantes avec le multi-modal
Contredire les images avec la vidéo. Si vos images sont sombres et lentes mais votre référence vidéo est rapide et brillante, la fusion devient confuse. Choisissez des entrées qui s'accordent.
Utiliser les références vidéo pour le style. Elles sont mouvement uniquement. Le style vient toujours des images.
Surutiliser les références audio. Un seul indice audio serré est plus efficace que 3 conflictuels.
Ignorer l'invite. Les références définissent le comment, l'invite définit toujours le quoi. Ne laissez pas l'invite vide.
Coût et temps de génération
La tarification multi-modal est identique à tout autre appel en mode Reference : 0,3024 $ par seconde de sortie. L'ajout de références vidéo et audio ne coûte pas supplémentaire.
| Durée | Crédits | Coût |
|---|---|---|
| 4 sec | 243 | 2,42 $ |
| 8 sec | 484 | 4,84 $ |
| 15 sec | 907 | 9,07 $ |
Le temps de génération est légèrement plus long que images uniquement parce que la fusion traite plus de données. Attendez-vous à 90-180 secondes pour les appels multi-modal par rapport à 60-120 pour images uniquement.
Un flux de travail de production multi-modal complet
Pour un projet de 10 clips où chaque clip doit correspondre :
1. Construire votre bundle de références (une fois, réutilisez pour tous les 10 clips) :
- 6 images définissant le style
- 2 références vidéo pour vos mouvements de caméra les plus utilisés
- 1 référence audio pour le ton émotionnel
2. Écrire 10 invites spécifiques au coup qui décrivent le sujet et l'action uniquement.
3. Exécuter les 10 générations en utilisant le même bundle de références, variant seulement l'invite.
4. Vérifier et itérer sur tous les clips qui ont dévié. Généralement 1-2 sur 10.
Coût total pour 10 clips à 8 secondes : ~4 840 crédits = ~48 $. C'est dans le $50 Pro tier avec du changement qui reste.
Comparaison multi-modal vs Standard
| Capacité | Seedance 2.0 Standard | Reference (Multi-Modal) |
|---|---|---|
| Contrôle du style | Invite uniquement | Jusqu'à 9 images |
| Contrôle du mouvement | Invite uniquement | Jusqu'à 3 références vidéo |
| Contrôle de l'ambiance | Invite uniquement | Jusqu'à 3 références audio |
| Complexité de la configuration | Faible | Modérée |
| Précision de la sortie | Modérée | Élevée |
| Meilleur pour | One-offs | Travail de précision |
Standard est plus rapide pour les idées simples. Reference multi-modal est l'option de précision quand vous avez besoin que la sortie corresponde à une intention spécifique. Consultez le Comparaison Reference vs Standard complet.
Avancé : Empiler les références à travers une séquence
Pour les séquences multi-plans avec des moments distincts, vous pouvez changer votre pile multi-modal entre les coups tout en gardant l'un constant.
Constant à travers la séquence : 5-6 images de style (pour la cohérence visuelle) Variable par coup : 1-2 images spécifiques au coup + 1 référence de mouvement
Les images constantes verrouillent la séquence ensemble. Les références variables vous permettent de capturer la nuance spécifique au coup. C'est le flux de travail sur lequel la plupart des utilisateurs pros atterrissent.
Où aller à partir d'ici
Si c'est votre première fois avec multi-modal, commencez petit. Essayez d'abord les générations images uniquement (tutoriel multi-image). Une fois à l'aise, ajoutez une référence de mouvement. Une fois que vous obtenez des résultats fiables, expérimentez avec l'audio.
Pour l'image de fonctionnalité complète, lisez le Guide Seedance 2.0 Reference. Pour des cas d'utilisation spécifiques, consultez vidéos de marque ou clips musicaux.
Multi-modal n'est pas une astuce - c'est la fonctionnalité qui sépare Seedance 2.0 Reference de tous les autres outils de vidéo IA du marché. Utilisez-la quand la précision importe.
Empilez des images, vidéo et audio en un seul appel
Voyez comment l'entrée multi-modal verrouille votre sortie vidéo IA. 50 crédits gratuits, sans carte requise.
Commencez à créer gratuitementTry Seedance 2.0 - Right Now
5 free generations · No credit card needed