Multi-Modale AI-video: Afbeeldingen, video en audio combineren met Arteza
Echte multi-modale AI-video betekent dat je het model meer dan alleen een prompt geeft. Hier lees je hoe je afbeeldingen, video en audioverwijzingen combineert in Seedance 2.0 Reference.

"Multi-modal" wordt losjes gebruikt in AI-marketing. De meeste tools die dit claimen bedoelen eigenlijk "we accepteren tekst en één afbeelding." Seedance 2.0 Reference is een van de weinige modellen die de term serieus neemt: tot 9 afbeeldingen, 3 videoclips en 3 audioclips, allemaal samengevoegd in één generatie.
Hier leert u hoe u alle drie invoertypen samen kunt gebruiken - en waarom deze combinatie dingen mogelijk maakt die geen enkele invoer alleen kan bereiken.
TL;DR
- Seedance 2.0 Reference accepteert afbeeldingen + video + audio als referentie in één aanroep
- Afbeeldingen bepalen de stijl, video bepaalt de beweging, audio bepaalt de sfeer
- Het combineren van alle drie geeft strakker output dan elk invoertype afzonderlijk
- Prijzen: $0.3024/sec, ongeacht hoeveel referenties u gebruikt
- Generatie: 60-180 seconden voor de gefuseerde multi-modale pipeline
- Probeer de volledige multi-modal stack gratis
Wat elk invoertype werkelijk controleert
Deze drie referentietypen overlappen niet - ze behandelen verschillende dimensies van de output.
Afbeeldingen bepalen de stijl. Kleurenpalet, verlichting, compositie, textuur, framing. Alles visueel wat geen beweging omvat.
Video bepaalt de beweging. Camerabewegingen, tempo, actievectoren, temporeel ritme. Niet de kleur of verlichting - het model extraheert beweging onafhankelijk van de visuele stijl van de video.
Audio bepaalt de sfeer. Emotionele voorkeuring die de visuele output subtiel beïnvloedt. Niet het geluid dat u in de output hoort (dat wordt apart gegenereerd), maar de stemmingsaanwijzing die beïnvloedt wat op het scherm staat.
Wanneer u alle drie samen gebruikt, vult elk gat op dat de anderen niet kunnen.
5 gratis generaties · Geen creditcard nodig
De Stack in Actie
Hier is een concrete multi-modale generatie die ik heb uitgevoerd.
Doel: Een dromerig, slowmotionshot van een vrouw die door een veld rent bij zonsopgang, in de stijl van een Terrence Malick-film.
Afbeeldingreferenties (6):
- 2 Malick-filmstills met warm licht bij zonsopgang
- 2 afbeeldingen van velden bij gouden uur
- 1 shot van het exacte lenskarakter dat ik wilde (zacht, dromerig bokeh)
- 1 hero-frame met de precieze sfeer
Videoreferenties (1):
- Een 3-secondenclip van een slowmotionlopende figuur gefilmd met een teleslens
Audioreferenties (1):
- 4 seconden zachte, schaarse piano
Prompt:
A woman in a white dress runs through tall grass at dawn, 8 seconds
Let op hoe minimaal de prompt is. De referenties doen al het werk.
De output kwam verbluffend dicht bij de intentie - stijl van de afbeeldingen, het specifieke slowmotionloopgevoel van de video, en een subtiel emotioneel gewicht van de audio dat ik niet zou hebben kunnen krijgen met alleen afbeeldingen.

Probeer de volledige multi-modale stack. Upload afbeeldingen, een bewegingsclip en een audioreferentie in één shot. Start gratis met 50 credits.
Afbeeldingreferenties: De Basis
Afbeeldingen zijn de zwaarste gewogen invoer in de fusie. Ze moeten altijd uw primaire stijlkanaal zijn. Gebruik minimum 4-6, tot 9 voor complexe stijlen.
Zie de toegewijde multi-image tutorial voor de volledige methodologie op afbeeldingscuratie. Samenvatting: overeenstemming is belangrijker dan aantal, behandel verschillende aspecten van de stijl, voeg één hero-frame toe.
Videoreferenties: De Bewegingslaag
Videoreferenties zijn waar multi-modal echt gescheiden is van zuivere op afbeeldingen gebaseerde workflows. Camerabewegingen in woorden beschrijven is echt moeilijk - "een langzame handmatig drift naar links met subtiel opheffen" verliest duidelijkheid telkens wanneer u het vertaalt naar proza.
Een 2-5 secondenvideorefentie slaat de vertaling over. Het model samplet bewegingsvectoren direct.
Beste toepassingen:
- Specifieke handmatig voelende beweging die u wilt aanpassen
- Lastige camerabewegingen (opheffen, dolly + pan-combo's, wipovergangen)
- Tempoaanwijzingen (snel snijden voelen versus langzaam contemplatief voelen)
- Actieritme voor sport- of dansinhoud
Wat videoreferenties niet doen:
- Ze dragen niet hun eigen stijl. Kleurgradering van de referentie zal niet overdragen - alleen beweging.
- Ze dicteren geen inhoud. Het onderwerp in de referentie verschijnt niet in uw output.
U kunt tot 3 videoreferenties per generatie gebruiken. Het stapelen van meerdere bewegingsreferenties vermengt ze - handig voor "tussen" twee referentiebewegingen.
Audioreferenties: De Sfeerlaag
Audioreferenties zijn het vreemdste van de drie. Ze verschijnen niet in het audiospoor van uw output (dat wordt vers gegenereerd om de scène te passen). In plaats daarvan geven ze de beelden een emotionele push.
Een stormachtige audioreferentie bevoordeelt dramatische verlichting en donkerder palet. Een vrolijke uptempo-referentie bevoordeelt helderder framing en meer beweging. Een schaarse weemoedige referentie bevoordeelt langere, tragere shots met coolere tinten.
Wanneer te gebruiken:
- De stijlreferenties en prompt zijn goed maar de output voelt emotioneel plat
- U wilt een sfeer die visueel moeilijk is uit te leggen
- U past output aan op een bestaande score of nummer
Wanneer over te slaan:
- Uw eerste paar generaties. Begin met alleen afbeeldingen. Voeg audioreferenties toe zodra u zich vertrouwd voelt met de baseline.
Tot 3 audioreferenties per generatie, samengevoegd.
Probeer Seedance 2.0 Reference - multi-modale videogeneratie
Combineer afbeeldings-, video- en audioreferenties in één generatie. 50 gratis credits, geen kaart vereist.
Probeer Seedance 2.0 Reference GratisDe Multi-modale Beslissingsboom
Niet elk project heeft alle drie invoeren nodig. Hier kunt u elk toevoegen:
Altijd: Afbeeldingreferenties (minimum 3+) Voeg videoreferentie toe als: U specifieke beweging nodig hebt die moeilijk is te beschrijven Voeg audioreferentie toe als: Uw output voelt emotioneel verkeerd na alleen-afbeeldingpogingen
Dwing multi-modal niet af wanneer een eenvoudigere stack werkt. Alleen-afbeeldingsgeneraties zijn sneller om in te stellen en vaak voldoende.
Veelgemaakte fouten met Multi-modal
De afbeeldingen tegenstellen met de video. Als uw afbeeldingen weemoedig en langzaam zijn maar uw videoreferentie snel en helder, raakt de fusie verward. Kies invoeren die akkoord gaan.
Videoreferenties voor stijl gebruiken. Ze zijn alleen beweging. Stijl komt nog steeds van afbeeldingen.
Audioreferenties overgebruiken. Een enkele strakke audio-aanwijzing is effectiever dan 3 conflicterende.
De prompt overslaan. Referenties definiëren hoe, de prompt definieert nog steeds wat. Laat de prompt niet leeg.
Kosten en Generatietijd
Multi-modale prijzen zijn identiek aan enige andere Reference-modus-aanroep: $0.3024 per seconde output. Het toevoegen van video- en audioreferenties kost niets extra.
| Duur | Credits | Kosten |
|---|---|---|
| 4 sec | 243 | $2.42 |
| 8 sec | 484 | $4.84 |
| 15 sec | 907 | $9.07 |
Generatietijd is iets langer dan alleen-afbeeldingen omdat de fusie meer gegevens verwerkt. Verwacht 90-180 seconden voor multi-modale aanroepen versus 60-120 voor alleen-afbeeldingen.
Een Volledige Multi-modale Productieworkflow
Voor een 10-clipproject waar elke clip moet passen:
1. Bouw uw referentiebundel (eenmaal, hergebruik voor alle 10 clips):
- 6 afbeeldingen die de stijl bepalen
- 2 videoreferenties voor uw meest gebruikte camerabewegingen
- 1 audioreferentie voor de emotionele toon
2. Schrijf 10 shotspecifieke prompts die alleen onderwerp en actie beschrijven.
3. Voer alle 10 generaties uit met dezelfde referentiebundel, variërend alleen de prompt.
4. Beoordeel en herhaal op alle clips die afdwaalden. Meestal 1-2 van de 10.
Totale kosten voor 10 clips op 8 seconden: 4.840 credits = **$48**. Dat is binnen de $50 Pro tier met wisselgeld over.
Multi-modal versus Standaard Vergelijking
| Mogelijkheid | Standaard Seedance 2.0 | Reference (Multi-modal) |
|---|---|---|
| Stijlcontrole | Alleen prompt | Tot 9 afbeeldingen |
| Bewegingscontrole | Alleen prompt | Tot 3 videoreferenties |
| Sfeercontrole | Alleen prompt | Tot 3 audioreferenties |
| Instellen van complexiteit | Laag | Matig |
| Output precisie | Matig | Hoog |
| Het beste voor | Eenmalige taken | Precisiewerk |
Standaard is sneller voor eenvoudige ideeën. Reference multi-modal is de precisie-optie wanneer u wilt dat de output aansluit bij een specifieke intentie. Zie de volledige Reference vs Standard breakdown.
Geavanceerd: Referenties in een Sequentie Stapelen
Voor multi-shot-sequenties met verschillende momenten kunt u uw multi-modale stack veranderen tussen shots terwijl één constant blijft.
Constant in sequentie: 5-6 stijlafbeeldingen (voor visuele consistentie) Variabel per shot: 1-2 shotspecifieke afbeeldingen + 1 bewegingsreferentie
De constante afbeeldingen vergrendelen de sequentie. De variabele referenties laten u shotspecifieke nuance vastleggen. Dit is de workflow waar de meeste professionele gebruikers op uitkomen.
Waar u vervolgens naartoe gaat
Als dit uw eerste keer met multi-modal is, start klein. Probeer eerst alleen-afbeeldinggeneraties (multi-image tutorial). Zodra u comfortabel bent, voeg een bewegingsreferentie toe. Zodra u betrouwbare resultaten krijgt, experimenteer met audio.
Voor het volledige functiepictogram, lees de Seedance 2.0 Reference gids. Voor specifieke gebruiksgevallen, zie merkvideo's of muziekvideo's.
Multi-modal is geen gimmick - het is de functie die Seedance 2.0 Reference onderscheidt van elk ander AI-videohulpmiddel op de markt. Gebruik het wanneer precisie belangrijk is.
Stack afbeeldingen, video en audio in één aanroep
Zie hoe multi-modale invoer uw AI-video-output vergrendelt. 50 gratis credits, geen kaart vereist.
Start gratis creërenTry Seedance 2.0 - Right Now
5 free generations · No credit card needed