AI-videovorming met meerdere invoeren: volledig gids
AI-videovorming met meerdere invoeren betekent meer dan alleen tekst aan het model geven. Hier is de volledige gids voor het gebruik van afbeeldings-, video- en audio-invoeren in Seedance 2.0 Reference.

De volgende fase van AI-video gaat niet over betere prompts, maar betere inputs. Twee jaar lang heeft de industrie één hendel geoptimaliseerd: de tekstprompt. Die hendel raakt op. De echte doorbraak ligt in het accepteren van rijkere inputs: afbeeldingen, videoclips, audio en combinaties van alle drie.
Seedance 2.0 Reference is het meest volledig multi-input AI-videomodel dat momenteel beschikbaar is, en dit is de complete handleiding voor het gebruik van elk inputtype samen.
TL;DR
- Multi-input = tekst + tot 9 afbeeldingen + tot 3 videoclips + tot 3 audioclips
- Elk inputtype controleert verschillende outputdimensies (stijl, beweging, sfeer)
- Allemaal gefuseerd in één generatie voor $0,3024/sec
- Generatietijd: 60-180 seconden ongeacht het aantal inputs
- De meest effectieve workflow voor nauwkeurige AI-video-output
- Probeer de volledige multi-input stack gratis
Waarom multi-input belangrijk is
Tekst is gecomprimeerde visuele informatie. Wanneer je "sfeervol, warm, cinematisch" schrijft, comprimeer je een rijkconcept visueel in zeven lettergrepen. Het model moet deze zeven lettergrepen terug uitbreiden naar beelden, en die uitbreiding verliest informatie.
Multi-input slaat de compressiestap over. In plaats van je stijl in woorden te beschrijven, toon je die direct. In plaats van beweging te beschrijven, toon je die. In plaats van sfeer te beschrijven, toon je die. Het model leest je inputs met volledige trouw.
Het resultaat is output die veel nauwkeuriger aansluit op je bedoeling, in de eerste generatie, zonder zoveel promptiteratiepoging.
5 gratis generaties · Geen creditcard nodig
De vier inputtypen
1. Tekstprompt (verplicht). Het enige wat tekst in een multi-input workflow moet doen: het onderwerp en de actie beschrijven. Laat stijl, sfeer en beweging aan de andere inputs over.
2. Referentieafbeeldingen (tot 9). Primaire stijlinput. Behandel kleur, verlichting, compositie, korrel, textuur.
3. Referentievideo's (tot 3). Bewegingsinput. Vang camerabeweging, tempo, actieritme.
4. Referentieaudio (tot 3). Sfeerinput. Beïnvloedt visuele output emotioneel, niet door het daadwerkelijk audiospoor van de output.
Samen geven deze je controle over elk aspect van de output zonder tekst alles te laten doen.
Hoe de fusie werkt
Onder de motorkap verwerkt Seedance 2.0 Reference elk inputtype via speciale encoders en fusioneert de resultaten in één conditioning signal. De tekstprompt gaat via een tekstencoder; afbeeldingen via een afbeeldingsencoder; video via een bewegingsencoder; audio via een audio-stemmingsencoder.
Het gefuseerde conditioning signal wordt vervolgens gebruikt om het videogeneratieproces te begeleiden. Je ziet dit niet, je ziet alleen inputs erin gaan en video eruit komen. Maar het begrijpen van de fusie helpt je bedenken welke inputs je zwaarder wilt wegen.
Ruwe gewichtsvolgorde:
- Tekst: sterke invloed op onderwerp en actie
- Afbeeldingen: sterke invloed op visuele stijl
- Video: sterke invloed op beweging
- Audio: subtiele invloed op visuele sfeer
Het ontbreken van een inputtype breekt de generatie niet. Het laat die dimensie gewoon aan het standaardgedrag over, wat voor eenvoudiger werk vaak prima is.

Voer je eerste multi-input generatie uit. Upload alle drie inputtypen en zie de nauwkeurigheid. Gratis starten.
Een volledig multi-input voorbeeld
Hier is een generatie met elk inputtype gebruikt.
Tekstprompt:
Een vrouw in een leren jasje zit op een motorfiets in een neonverlichte
steeg 's nachts, camera duwt langzaam in, 8 seconden
Afbeeldingsreferenties (7):
- 3 standbeelden uit Blade Runner (kleur, verlichting)
- 2 cyberpunk-fotografieopnames (compositie, korrel)
- 1 motorfiets productfoto (onderwerpspositionering)
- 1 hero frame (algehele vibe target)
Videoreferentie (1):
- 3-secondes clip van langzame dolly push naar onderwerp
Audioreferentie (1):
- 5-secondes clip van een synthdroon met subtiele regen
Resultaat:
- Stijl: Sterk Blade Runner, vastgezet door de afbeeldingen
- Beweging: Komt exact overeen met de dolly push referentie
- Sfeer: Subtiele regennatte sfeer uit de audiohint
Totale inputs: 7 afbeeldingen + 1 video + 1 audio + 1 prompt. Generatietijd: ~120 seconden. Output: exact wat ik wilde bij de eerste poging.
Vergelijk dat met prompt-only workflows waarbij het vaak 5-10 generaties kost om de beoogde look te benaderen. Multi-input bespaart je iteratiekosten en past je intentie veel nauwkeuriger in.
Wanneer elk inputtype toevoegen
Je hebt niet altijd alles vier nodig. Hier is wanneer elk waarde toevoegt.
Alleen tekst: Nooit. Je hebt altijd minstens één referentietype nodig voor Reference-modus.
Tekst + afbeeldingen: Meest gebruikte setup. Werkt voor 70% van projecten.
Tekst + afbeeldingen + video: Wanneer je specifieke beweging nodig hebt die moeilijk te beschrijven is.
Tekst + afbeeldingen + audio: Wanneer sfeer verder moet verschuiven dan wat afbeeldingen alleen kunnen doen.
Allemaal vier: Wanneer maximale nauwkeurigheid ertoe doet, brand work, hero shots, uiteindelijke deliverables.
Begin met tekst + afbeeldingen en voeg andere inputs toe naarmate je de grenzen van die setup bereikt.
Multi-input workflows voor verschillende use cases
Voor brandvideos: Tekst + 6-9 brandafbeeldingen + 1-2 bewegingsreferenties die je handtekeningcamerastijl tonen. Sla audioreferenties over tenzij je een specifieke sfeertarget hebt.
Voor videoclips: Tekst + 6-9 stijlafbeeldingen + 1 audioreferentie die de sfeer van het nummer aansluit. Videoreferenties optioneel.
Voor storyboards: Tekst + 4-6 concept art afbeeldingen + 1 bewegingsreferentie per shottype. Sla audio over.
Voor productlaunches: Tekst + 5-7 productfoto's + 1 lifestyle/brandbeweingsreferentie. Sla audio over tenzij het product sfeerkoppelingen heeft.
Voor editorial/fashion: Tekst + 6-9 lookboeafbeeldingen + 1 loop/pose bewegingsreferentie. Sla audio over tenzij de shoot een bijbehorend soundtrack heeft.
Probeer Seedance 2.0 Reference - multimodale videogeneratie
Volledige multi-input controle: afbeeldings-, video- en audioreferenties in één aanroep. 50 gratis credits, geen kaart vereist.
Seedance 2.0 Reference gratis proberenKosten en snelheidsconsideraties
Multi-input generaties kosten hetzelfde per seconde als single-input generaties: $0,3024 per seconde output. Het toevoegen van referentietypen verhoogt de kosten niet.
| Duur | Credits | Kosten |
|---|---|---|
| 4 sec | 243 | $2,42 |
| 8 sec | 484 | $4,84 |
| 15 sec | 907 | $9,07 |
Snelheid: Multi-input generaties duren iets langer dan alleen-tekst omdat het model meer inputgegevens verwerkt. Verwacht 90-180 seconden voor multi-input aanroepen versus 60-120 voor alleen-afbeelding aanroepen. De extra wachttijd is bijna altijd de nauwkeurigheidswinst waard.
Veelgemaakte multi-input fouten
Tegenstrijdige inputs. Als je afbeeldingen "sfeervol en langzaam" zeggen en je audio "opgewekt en snel", raakt de fusie in verwarring. Kies inputs die het eens zijn over sfeer.
Videoreferenties gebruiken voor stijl. Videoreferenties beïnvloeden alleen beweging, niet stijl. Kies ze niet op basis van hun visuele uitstraling.
Audio overbelasten. Eén of twee audioreferenties is meestal genoeg. Drie kunnen het stemeringssignaal verdunnen.
De prompt overslaan. Zelfs met sterke referenties heb je een tekstprompt nodig voor onderwerp en actie. Een lege prompt produceert generieke content.
Inputs tussen clips in een serie wijzigen. Als je meerdere clips produceert die verwant moeten aanvoelen, gebruik identieke referentiebundels over allemaal.
Multi-input vergelijken met single-input
Hier is een side-by-side vergelijking die ik met hetzelfde scenario uitvoerde.
Scenario: Korte atmosferische clip van een regennatte stadsstraat 's nachts.
Alleen-tekst poging:
Atmosferische opname van een regennatte stadsstraat 's nachts, neon reflecties,
sfeervol cinematisch licht, langzame camerabeweging, 5 seconden
Resultaat: Aanvaardbaar maar generiek. Kan elke noir-stijl AI-clip zijn. Kreeg het bij de 4e generatie na het herhalen van de prompt.
Multi-input poging:
- Dezelfde prompt zonder stijltaal
- 6 Blade Runner standbeelden
- 1 dolly push videoreferentie
- 1 regenen synth audioreferentie
Resultaat: Specifiek, vastgezet, kwam overeen met mijn beoogde sfeer bij de eerste poging.
Tijdbesparing: ~8 minuten iteratie geëlimineerd. Kostenbesparing: 3 minder generatiepogingen op ~$3 elk = ~$9 bespaard.
Vermenigvuldig dat over een project met 20+ clips en multi-input workflows betalen voor zichzelf vele malen.
Multi-input versus standaard Seedance 2.0
Het waard op te merken: standard Seedance 2.0 is een tekst-naar-video / afbeelding-naar-video werkpaard. Het is single-input. Als je alleen een prompt en één afbeelding nodig hebt, is standard sneller in te stellen.
Multi-input met Seedance 2.0 Reference is voor wanneer nauwkeurigheid belangrijker is dan instellingssnelheid. Zie het volledige Reference vs Standard vergelijking voor het besluitvormingsraamwerk.
Tips voor inputvoorbereiding
Afbeeldingen: 512px+ op korte rand, JPG of PNG, idealiter uit een consistente stiloumbron.
Video: 2-5 seconden per clip, willekeurig beeldverhoudingverhouding, MP4 bij voorkeur.
Audio: 4-10 seconden per clip, MP3 of WAV, overeenkomstig je doeisfeer.
Overmaak inputvoorbereiding niet. Het model is vrij tolerant voor resolutie, formaat en bestandsgrootte. Wat telt is inhoudelijke relevantie, niet technische perfectie.
Een multi-input bibliotheek bouwen
Geavanceerde gebruikers bouwen een persoonlijke bibliotheek van herbruikbare inputs:
- Stijlbundels voor verschillende genres/buien (noir, pastoraal, episch, enz.)
- Bewegingsclips voor veel voorkomende camerabeweging (dolly in, handheld, statische hold, enz.)
- Audiohints voor emotionele tonen (melancholisch, hoopvol, gespannen, enz.)
Met een bibliotheek is het starten van een nieuw project gewoon het combineren van bestaande inputs in plaats van alles vers in te dienen. Je ontwikkelt een "geluid", een herkenbare stijl die over je werk loopt omdat je inputs consistent zijn.
Verder gaan
Voor een praktische diepte op de multimodale combinatie, lees multi-modal AI video. Voor de afbeeldingsspecifieke workflow, zie de multi-image tutorial. Voor het groot beeld functieoverzicht, de Seedance 2.0 Reference complete gids is de juiste lees.
Multi-input is hoe AI-video nauwkeurig wordt. Leer de workflow eenmaal en je generatiekwaliteit springt permanent omhoog.
Probeer de volledige multi-input stack
Upload afbeeldings-, video- en audioreferenties in één generatie. 50 gratis credits, geen kaart vereist.
Begin gratis met makenTry Seedance 2.0 - Right Now
5 free generations · No credit card needed