Vidéo IA multimodale : combiner images, vidéo et audio avec Arteza
La vraie vidéo IA multimodale consiste à fournir au modèle bien plus qu'un simple prompt. Voici comment combiner images, vidéos et références audio dans Seedance 2.0 Reference.

« Multi-modal » est un terme utilisé à tort et à travers dans le marketing IA. La plupart des outils qui s'en réclament acceptent en réalité « du texte et une image ». Seedance 2.0 Reference est l'un des rares modèles qui prend ce terme au sérieux : jusqu'à 9 images, 3 clips vidéo et 3 clips audio, tous fusionnés en une seule génération.
Voici comment utiliser concrètement les trois types d'entrées ensemble, et pourquoi leur combinaison ouvre des possibilités qu'aucune entrée isolée ne peut offrir.
En bref
- Seedance 2.0 Reference accepte images + vidéo + audio comme référence en un seul appel
- Les images définissent le style, la vidéo définit le mouvement, l'audio définit l'ambiance
- Combiner les trois produit un résultat plus précis que n'importe quel type d'entrée seul
- Tarif : 0,3024 dollar/seconde, quel que soit le nombre de références utilisées
- Génération : 60 à 180 secondes pour le pipeline multi-modal fusionné
- Essayez gratuitement la pile multimodale complète
Ce que chaque type d'entrée contrôle réellement
Ces trois types de références ne se recoupent pas : ils agissent sur des dimensions différentes du résultat.
Les images contrôlent le style. La palette de couleurs, l'éclairage, la composition, la texture, le cadrage. Tout ce qui est visuel et n'implique pas de mouvement.
La vidéo contrôle le mouvement. Les mouvements de caméra, le rythme, les vecteurs d'action, la dynamique temporelle. Pas la couleur ni l'éclairage : le modèle extrait le mouvement indépendamment du style visuel de la vidéo.
L'audio contrôle l'ambiance. Un biais émotionnel qui influe subtilement sur le résultat visuel. Ce n'est pas le son que l'on entend dans le résultat final (celui-ci est généré séparément), mais le signal d'ambiance qui influence ce qui apparaît à l'écran.
Lorsque vous utilisez les trois ensemble, chacun comble un vide que les autres ne peuvent pas remplir.
5 générations gratuites · Aucune carte de crédit requise
La combinaison en action
Voici une génération multi-modale concrète que j'ai réalisée.
Objectif : Un plan onirique au ralenti d'une femme courant dans un champ à l'aube, dans le style d'un film de Terrence Malick.
Références images (6) :
- 2 photogrammes de films de Malick montrant la lumière chaude de l'aube
- 2 images de champs à l'heure dorée
- 1 plan illustrant exactement le caractère optique souhaité (bokeh doux et onirique)
- 1 cadre principal définissant l'ambiance précise
Références vidéo (1) :
- Un clip de 3 secondes d'une silhouette courant au ralenti, filmée avec un long objectif
Références audio (1) :
- 4 secondes de piano doux et épuré
Prompt :
A woman in a white dress runs through tall grass at dawn, 8 seconds
Notez à quel point le prompt est minimaliste. Les références prennent en charge tout le reste.
Le résultat était étonnamment fidèle à l'intention : le style vient des images, la sensation spécifique de course au ralenti vient de la vidéo, et une charge émotionnelle subtile vient de l'audio, ce que je n'aurais pas pu obtenir avec des images seules.

Essayez la combinaison multi-modale complète. Chargez des images, un clip de mouvement et une référence audio en une seule fois. Commencez gratuitement avec 10 crédits.
Références images : la base
Les images sont l'entrée la plus fortement pondérée dans la fusion. Elles doivent toujours constituer votre canal de style principal. Utilisez 4 à 6 images au minimum, jusqu'à 9 pour les styles complexes.
Consultez le tutoriel multi-image dédié pour la méthodologie complète de sélection des images. En résumé : la cohérence importe plus que la quantité, couvrez différentes facettes du style et incluez un cadre principal.
Références vidéo : la couche de mouvement
Les références vidéo sont ce qui distingue vraiment le multi-modal des flux de travail basés sur les images seules. Décrire un mouvement de caméra en mots est véritablement difficile : « un léger dérive à la main vers la gauche avec une légère montée en grue » perd en précision à chaque fois qu'on le traduit en prose.
Une référence vidéo de 2 à 5 secondes contourne cette traduction. Le modèle échantillonne directement les vecteurs de mouvement.
Meilleures utilisations :
- Une sensation de main levée spécifique à reproduire
- Des mouvements de caméra complexes (grue, combinaison travelling + panoramique, transitions rapides)
- Des indications de rythme (sensation de coupes rapides ou de contemplation lente)
- Le rythme d'action pour les contenus sportifs ou de danse
Ce que les références vidéo ne font pas :
- Elles ne transmettent pas leur propre style. L'étalonnage colorimétrique de la référence ne se transfère pas, seul le mouvement est repris.
- Elles ne dictent pas le contenu. Le sujet de la référence n'apparaît pas dans votre résultat.
Vous pouvez utiliser jusqu'à 3 références vidéo par génération. L'empilement de plusieurs références de mouvement les fusionne, ce qui est utile pour obtenir un résultat « entre » deux mouvements de référence.
Références audio : la couche d'ambiance
Les références audio sont les plus étranges des trois. Elles n'apparaissent pas dans la piste audio de votre résultat (celle-ci est générée à nouveau pour correspondre à la scène). Elles influencent plutôt les visuels sur le plan émotionnel.
Une référence audio orageuse oriente vers un éclairage dramatique et une palette plus sombre. Une référence entraînante et joyeuse oriente vers un cadrage plus lumineux et plus de mouvement. Une référence mélancolique et épurée oriente vers des plans plus longs et plus lents avec des tons plus froids.
Quand les utiliser :
- Les références de style et le prompt sont solides, mais le résultat semble émotionnellement plat
- Vous souhaitez une ambiance difficile à décrire visuellement
- Vous faites correspondre le résultat à une musique ou une chanson existante
Quand les ignorer :
- Pour vos premières générations. Commencez avec des images uniquement. Ajoutez des références audio une fois que vous maîtrisez la base.
Jusqu'à 3 références audio par génération, fusionnées ensemble.
Essayez Seedance 2.0 Reference : génération vidéo multi-modale
Combinez images, vidéo et références audio en une seule génération. Crédits offerts, sans carte bancaire requise.
Essayer Seedance 2.0 Reference gratuitementL'arbre de décision multi-modal
Tous les projets n'ont pas besoin des trois types d'entrées. Voici quand ajouter chacun :
Toujours : des références images (3 minimum) Ajoutez une référence vidéo si : vous avez besoin d'un mouvement spécifique difficile à décrire Ajoutez une référence audio si : votre résultat semble émotionnellement faux après des essais avec les images seules
Ne forcez pas le multi-modal lorsqu'une combinaison plus simple suffit. Les générations avec images uniquement sont plus rapides à configurer et souvent suffisantes.
Erreurs courantes avec le multi-modal
Contredire les images avec la vidéo. Si vos images sont sombres et lentes mais que votre référence vidéo est rapide et lumineuse, la fusion sera perturbée. Choisissez des entrées cohérentes entre elles.
Utiliser les références vidéo pour le style. Elles ne servent qu'au mouvement. Le style provient toujours des images.
Abuser des références audio. Un seul signal audio précis est plus efficace que 3 références contradictoires.
Négliger le prompt. Les références définissent le comment, le prompt définit toujours le quoi. Ne laissez pas le prompt vide.
Coût et temps de génération
La tarification multi-modale est identique à tout autre appel en mode Reference : 0,3024 dollar par seconde de résultat. L'ajout de références vidéo et audio ne génère pas de coût supplémentaire.
| Durée | Crédits | Coût |
|---|---|---|
| 4 sec | 19 | 1,90 dollar |
| 8 sec | 37 | 3,70 dollars |
| 15 sec | 69 | 6,90 dollars |
Le temps de génération est légèrement plus long qu'avec des images seules, car la fusion traite davantage de données. Comptez 90 à 180 secondes pour les appels multi-modaux, contre 60 à 120 secondes pour les générations avec images uniquement.
Un flux de travail de production multi-modal complet
Pour un projet de 10 clips où chaque clip doit correspondre à un style cohérent :
1. Constituez votre lot de références (une fois, réutilisé pour les 10 clips) :
- 6 images définissant le style
- 2 références vidéo pour vos mouvements de caméra les plus utilisés
- 1 référence audio pour le ton émotionnel
2. Rédigez 10 prompts propres à chaque plan décrivant uniquement le sujet et l'action.
3. Lancez les 10 générations en utilisant le même lot de références, en ne faisant varier que le prompt.
4. Révisez et ajustez les clips qui ont dévié. En général, 1 à 2 sur 10.
Coût total pour 10 clips de 8 secondes : environ 4 840 crédits = environ 48 dollars. Cela entre dans le $50 Pro tier, avec de la marge.
Comparaison multi-modal et standard
| Capacité | Seedance 2.0 standard | Reference (multi-modal) |
|---|---|---|
| Contrôle du style | Prompt uniquement | Jusqu'à 9 images |
| Contrôle du mouvement | Prompt uniquement | Jusqu'à 3 références vidéo |
| Contrôle de l'ambiance | Prompt uniquement | Jusqu'à 3 références audio |
| Complexité de configuration | Faible | Modérée |
| Précision du résultat | Modérée | Élevée |
| Idéal pour | Projets ponctuels | Travail de précision |
Le mode standard est plus rapide pour les idées simples. Le multi-modal Reference est l'option de précision lorsque vous avez besoin que le résultat corresponde à une intention spécifique. Consultez la Comparaison Reference vs Standard complète.
Avancé : empiler les références sur une séquence
Pour des séquences multi-plans avec des moments distincts, vous pouvez modifier votre combinaison multi-modale entre les plans tout en conservant un élément constant.
Constant sur toute la séquence : 5 à 6 images de style (pour la cohérence visuelle) Variable par plan : 1 à 2 images spécifiques au plan + 1 référence de mouvement
Les images constantes ancrent la séquence dans un style unifié. Les références variables permettent de capturer la nuance propre à chaque plan. C'est le flux de travail que la plupart des utilisateurs avancés adoptent.
Et maintenant ?
Si c'est votre première expérience avec le multi-modal, commencez petit. Essayez d'abord les générations avec images uniquement (tutoriel multi-image). Une fois à l'aise, ajoutez une référence de mouvement. Lorsque vous obtenez des résultats fiables, expérimentez avec l'audio.
Pour une vue d'ensemble complète des fonctionnalités, lisez Guide Seedance 2.0 Reference. Pour des cas d'usage spécifiques, consultez vidéos de marque ou clips musicaux.
Le multi-modal n'est pas un gadget : c'est la fonctionnalité qui distingue Seedance 2.0 Reference de tous les autres outils vidéo IA du marché. Utilisez-le lorsque la précision est primordiale.
Combinez images, vidéo et audio en un seul appel
Découvrez comment les entrées multi-modales verrouillent le rendu de votre vidéo IA. Crédits offerts, sans carte bancaire requise.
Commencer à créer gratuitementEssayez Seedance 2.0 - Maintenant
5 générations gratuites · Aucune carte de crédit requise