Multimodale AI-video: afbeeldingen, video en audio combineren met Arteza
Echte multimodale AI-video betekent dat je het model meer geeft dan alleen een prompt. Zo combineer je afbeeldingen, video en audioreferenties in Seedance 2.0 Reference.

"Multi-modaal" wordt losjes rondgegooid in AI-marketing. De meeste tools die dit beweren betekenen eigenlijk "we accepteren tekst en één afbeelding." Seedance 2.0 Reference is een van de weinige modellen die de term serieus neemt: tot 9 afbeeldingen, 3 videoclips en 3 audioclips, allemaal samengevoegd tot één enkele generatie.
Hier lees je hoe je alle drie de invoertypes samen gebruikt, en waarom de combinatie mogelijkheden ontsluit die geen enkel afzonderlijk invoertype biedt.
TL;DR
- Seedance 2.0 Reference accepteert afbeeldingen + video + audio als referentie in één aanroep
- Afbeeldingen sturen stijl, video stuurt beweging, audio stuurt sfeer
- De combinatie van alle drie levert nauwkeuriger resultaat dan elk afzonderlijk invoertype
- Prijs: $0,3024/sec, ongeacht het aantal referenties dat je gebruikt
- Generatietijd: 60-180 seconden voor de gecombineerde multi-modale pipeline
- Probeer de volledige multi-modale stack gratis
Wat elk invoertype precies bepaalt
Deze drie referentietypes overlappen niet: ze sturen verschillende dimensies van het resultaat.
Afbeeldingen bepalen de stijl. Kleurenpalet, belichting, compositie, textuur en kadrering. Alles wat visueel is en geen beweging betreft.
Video bepaalt de beweging. Camerabewegingen, tempo, actievectoren en tijdsritme. Niet de kleur of belichting: het model extraheert beweging onafhankelijk van de visuele stijl van de video.
Audio bepaalt de sfeer. Een emotionele lading die de visuele output subtiel beïnvloedt. Niet het geluid dat je in de output hoort (dat wordt apart gegenereerd), maar de sfeeraanwijzing die bepaalt wat er op het scherm te zien is.
Wanneer je alle drie samen gebruikt, vult elk element een leemte die de andere niet kunnen opvullen.
5 gratis generaties · Geen creditcard nodig
De combinatie in de praktijk
Hier is een concrete multi-modale generatie die ik heb uitgevoerd.
Doel: Een dromerige slowmotionopname van een vrouw die bij dageraad door een veld rent, in de stijl van een Terrence Malick-film.
Afbeeldingsreferenties (6):
- 2 Malick-filmstills met warm ochtendlicht
- 2 afbeeldingen van velden in het gouden uur
- 1 opname met precies het lenskarakter dat ik wilde (zachte, dromerige bokeh)
- 1 heldenframe dat de exacte sfeer toont
Videoreferenties (1):
- Een clip van 3 seconden van een slowmotionfiguur opgenomen met een lange lens
Audioreferenties (1):
- 4 seconden zacht, spaarzaam pianospel
Prompt:
A woman in a white dress runs through tall grass at dawn, 8 seconds
Let op hoe minimaal de prompt is. De referenties regelen al het overige.
Het resultaat lag verrassend dicht bij het beoogde beeld: de stijl kwam van de afbeeldingen, het specifieke slowmotiongevoel van de hardlopende figuur van de video, en een subtiel emotioneel gewicht van de audio dat ik met alleen afbeeldingen nooit had kunnen bereiken.

Probeer de volledige multi-modale combinatie. Upload afbeeldingen, een bewegingsclip en een audioreferentie in één keer. Begin gratis met 10 credits.
Afbeeldingsreferenties: de basis
Afbeeldingen zijn de zwaarst gewogen input in de samenvoeging. Ze moeten altijd je primaire stijlkanaal zijn. Gebruik minimaal 4-6, en tot 9 voor complexe stijlen.
Zie de speciale multi-afbeelding tutorial voor de volledige methodologie voor het samenstellen van afbeeldingen. Samenvatting: samenhang telt zwaarder dan aantal, dek verschillende facetten van de stijl af en voeg één heldenframe toe.
Videoreferenties: de bewegingslaag
Videoreferenties zijn waar multi-modaal zich echt onderscheidt van puur op afbeeldingen gebaseerde workflows. Camerabeweging in woorden beschrijven is oprecht moeilijk: "een trage handheld-drift naar links terwijl de camera subtiel omhoog kraant" verliest precisie elke keer dat je het naar proza vertaalt.
Een videoreferentie van 2-5 seconden slaat die vertaling over. Het model samplet bewegingsvectoren direct.
Beste toepassingen:
- Een specifiek handheld-gevoel dat je wilt nabootsen
- Lastige camerabewegingen (kraanshots, dolly plus pan-combinaties, zweiptransities)
- Tempoaanwijzingen (snelle montage versus langzaam contemplatief gevoel)
- Actieritme voor sport- of danscontent
Wat videoreferenties niet doen:
- Ze nemen hun eigen stijl niet over. De kleurgrading van de referentie wordt niet overgedragen, alleen de beweging.
- Ze bepalen de inhoud niet. Het onderwerp in de referentie verschijnt niet in je output.
Je kunt tot 3 videoreferenties per generatie gebruiken. Meerdere bewegingsreferenties stapelen vermengt ze, wat handig is om "tussen" twee referentiebewegingen uit te komen.
Audioreferenties: de sfeerlaag
Audioreferenties zijn de vreemdste van de drie. Ze verschijnen niet in de audiotrack van je output (die wordt vers gegenereerd passend bij de scène). In plaats daarvan sturen ze de visuele output emotioneel bij.
Een stormachtige audioreferentie stuurt aan op dramatische belichting en een donkerder palet. Een vrolijke uptempo-referentie stuurt aan op een heldere kadrering en meer beweging. Een sobere, melancholische referentie stuurt aan op langere, tragere shots met koelere tinten.
Wanneer je ze gebruikt:
- De stijlreferenties en prompt zijn goed, maar de output voelt emotioneel vlak
- Je wilt een sfeer die visueel moeilijk te beschrijven is
- Je wilt de output laten aansluiten op een bestaande score of nummer
Wanneer je ze weglaat:
- In je eerste paar generaties. Begin alleen met afbeeldingen. Voeg audioreferenties toe zodra je vertrouwd bent met de basislijn.
Tot 3 audioreferenties per generatie, samen gemengd.
Probeer Seedance 2.0 Reference: multi-modale videogeneratie
Combineer afbeeldingen, video en audioreferenties in één generatie. Gratis credits, geen creditcard nodig.
Probeer Seedance 2.0 Reference gratisDe beslisboom voor multi-modaal gebruik
Niet elk project heeft alle drie de inputs nodig. Hier lees je wanneer je elk type toevoegt:
Altijd: afbeeldingsreferenties (minimaal 3) Voeg een videoreferentie toe als: je specifieke beweging nodig hebt die moeilijk te beschrijven is Voeg een audioreferentie toe als: je output na pogingen met alleen afbeeldingen emotioneel niet klopt
Forceer multi-modaal niet als een eenvoudigere combinatie volstaat. Generaties met alleen afbeeldingen zijn sneller op te zetten en vaak toereikend.
Veelgemaakte fouten bij multi-modaal gebruik
De afbeeldingen tegenspreken met de video. Als je afbeeldingen sfeervol en traag zijn maar je videoreferentie snel en helder, raakt de samenvoeging in de war. Kies inputs die met elkaar overeenstemmen.
Videoreferenties gebruiken voor stijl. Ze zijn puur voor beweging. Stijl komt nog steeds van afbeeldingen.
Te veel audioreferenties gebruiken. Één scherpe, gerichte audiocue is effectiever dan 3 tegenstrijdige.
De prompt weglaten. Referenties bepalen hoe, de prompt bepaalt nog steeds wat. Laat de prompt niet leeg.
Kosten en generatietijd
De prijs voor multi-modaal is identiek aan elke andere Reference-modus-aanroep: $0,3024 per seconde output. Het toevoegen van video- en audioreferenties kost niets extra.
| Duur | Credits | Kosten |
|---|---|---|
| 4 sec | 19 | $1,90 |
| 8 sec | 37 | $3,70 |
| 15 sec | 69 | $6,90 |
De generatietijd is iets langer dan bij alleen afbeeldingen, omdat de samenvoeging meer data verwerkt. Reken op 90-180 seconden voor multi-modale aanroepen versus 60-120 seconden voor alleen afbeeldingen.
Een volledige multi-modale productieworkflow
Voor een project van 10 clips waarbij elke clip moet overeenkomen:
1. Stel je referentiepakket samen (eenmalig, herbruikbaar voor alle 10 clips):
- 6 afbeeldingen die de stijl definiëren
- 2 videoreferenties voor je meest gebruikte camerabewegingen
- 1 audioreferentie voor de emotionele toon
2. Schrijf 10 shot-specifieke prompts die alleen het onderwerp en de actie beschrijven.
3. Voer alle 10 generaties uit met hetzelfde referentiepakket, waarbij je alleen de prompt varieert.
4. Bekijk en pas aan bij clips die zijn afgeweken. Doorgaans 1-2 van de 10.
Totale kosten voor 10 clips van 8 seconden: circa 4.840 credits = circa $48. Dat past binnen het $50 Pro-abonnement met wat wisselgeld over.
Vergelijking: multi-modaal versus standaard
| Mogelijkheid | Standaard Seedance 2.0 | Reference (multi-modaal) |
|---|---|---|
| Stijlcontrole | Alleen prompt | Tot 9 afbeeldingen |
| Bewegingscontrole | Alleen prompt | Tot 3 videoreferenties |
| Sfeercontrole | Alleen prompt | Tot 3 audioreferenties |
| Complexiteit van de setup | Laag | Gemiddeld |
| Precisie van de output | Gemiddeld | Hoog |
| Beste voor | Losse opdrachten | Precisiework |
Standaard is sneller voor eenvoudige ideeën. Reference multi-modaal is de precisieoptie wanneer je output exact moet aansluiten op een specifiek doel. Zie de volledige Vergelijking Reference vs. Standard.
Geavanceerd: referenties gelaagd over een sequentie
Voor multi-shot-sequenties met duidelijk onderscheiden momenten kun je je multi-modale combinatie per shot wijzigen en één element constant houden.
Constant door de hele sequentie: 5-6 stijlafbeeldingen (voor visuele consistentie) Variabel per shot: 1-2 shot-specifieke afbeeldingen plus 1 bewegingsreferentie
De vaste afbeeldingen houden de sequentie bij elkaar. De variabele referenties geven je ruimte voor shot-specifieke nuances. Dit is de workflow waar de meeste gevorderde gebruikers op uitkomen.
Waar je hierna naartoe gaat
Als je multi-modaal voor het eerst probeert, begin dan klein. Probeer eerst generaties met alleen afbeeldingen (multi-afbeelding tutorial). Zodra je er vertrouwd mee bent, voeg je een bewegingsreferentie toe. Wanneer je betrouwbare resultaten krijgt, experimenteer je met audio.
Voor het volledige overzicht van de functies, lees de Seedance 2.0 Reference-gids. Bekijk voor specifieke toepassingen merkvideos of muziekvideos.
Multi-modaal is geen gimmick: het is de functie die Seedance 2.0 Reference onderscheidt van elk ander AI-videotool op de markt. Gebruik het wanneer precisie telt.
Combineer afbeeldingen, video en audio in één aanroep
Ontdek hoe multi-modale input je AI-video-output vastzet. Gratis credits, geen creditcard nodig.
Begin gratis met makenSeedance 2.0 uitproberen - Nu!
5 gratis generaties · Geen creditcard nodig