Multi-input AI-videogeneratie: complete gids
Multi-input AI-video betekent dat je het model meer aanlevert dan alleen tekst. Dit is de complete gids voor het gebruik van afbeeldingen, video en audio-invoer in Seedance 2.0 Reference.

De volgende fase van AI-video draait niet om betere prompts, maar om betere invoer. Twee jaar lang heeft de industrie aan één knop gedraaid: de tekstprompt. Maar die knop heeft zijn grenzen bereikt. De echte doorbraak zit in het accepteren van rijkere invoer: afbeeldingen, videoclips, audio en combinaties van alle drie.
Seedance 2.0 Reference is momenteel het meest complete multi-invoer AI-videomodel dat beschikbaar is, en dit is de volledige gids voor het gebruik van elk invoertype samen.
TL;DR
- Multi-invoer = tekst + maximaal 9 afbeeldingen + maximaal 3 videoclips + maximaal 3 audioclips
- Elk invoertype stuurt andere uitvoerdimensies aan (stijl, beweging, sfeer)
- Alles samengevoegd in één generatie voor $0.3024/sec
- Generatietijd: 60-180 seconden ongeacht het aantal invoerbestanden
- De meest effectieve workflow voor nauwkeurige AI-video-uitvoer
- Probeer de volledige multi-input stack gratis
Waarom multi-invoer belangrijk is
Tekst is gecomprimeerde visuele informatie. Als je schrijft "melancholisch, warm, cinematografisch", neem je een rijk visueel concept en comprimeer je het verliesgevend tot zeven lettergrepen. Het model moet die zeven lettergrepen dan weer uitbreiden naar beelden, en bij die uitbreiding gaat informatie verloren.
Multi-invoer slaat de compressiestap over. In plaats van je stijl in woorden te beschrijven, laat je die direct zien. In plaats van beweging te beschrijven, laat je die zien. In plaats van sfeer te beschrijven, laat je die zien. Het model leest je invoer op volledige kwaliteit.
Het resultaat is uitvoer die je intentie nauwkeuriger raakt, al bij de eerste generatie, zonder veel prompt-iteraties.
5 gratis generaties · Geen creditcard nodig
De vier invoertypen
1. Tekstprompt (verplicht). Het enige wat tekst in een multi-invoer workflow moet doen: het onderwerp en de actie beschrijven. Laat stijl, sfeer en beweging over aan de andere invoertypen.
2. Referentieafbeeldingen (maximaal 9). Primaire stijlinvoer. Dek kleur, belichting, compositie, korrel en textuur af.
3. Referentievideo's (maximaal 3). Bewegingsinvoer. Leg camerabewegingen, tempo en actiritme vast.
4. Referentieaudio (maximaal 3). Sfeerinvoer. Stuurt de visuele uitvoer emotioneel aan, niet via het daadwerkelijke audiokanaal van de uitvoer.
Samen geven deze je controle over elke dimensie van de uitvoer, zonder dat je tekst alles hoeft te laten doen.
Hoe de fusie werkt
Achter de schermen verwerkt Seedance 2.0 Reference elk invoertype via speciale encoders en combineert de resultaten tot één enkel conditioneringssignaal. De tekstprompt gaat door een tekstencoder, afbeeldingen gaan door een afbeeldingsencoder, video gaat door een bewegingsencoder en audio gaat door een audio-sfeerencoder.
Het gecombineerde conditioneringssignaal wordt vervolgens gebruikt om het videogeneratieproces te sturen. Je ziet hier niets van: je geeft invoer mee en er komt video uit. Maar het begrijpen van de fusie helpt je na te denken over welke invoer je zwaarder wilt laten wegen.
Globale gewichtsvolgorde:
- Tekst: sterke invloed op onderwerp en actie
- Afbeeldingen: sterke invloed op visuele stijl
- Video: sterke invloed op beweging
- Audio: subtiele invloed op visuele sfeer
Een ontbrekend invoertype breekt de generatie niet. Het laat die dimensie gewoon over aan standaardgedrag, wat voor eenvoudiger werk vaak prima is.

Voer je eerste multi-invoer generatie uit. Upload alle drie invoertypen en zie de nauwkeurigheid. Gratis beginnen.
Een volledig multi-invoer voorbeeld
Hier is een generatie waarbij elk invoertype is gebruikt.
Tekstprompt:
Een vrouw in een leren jack zit op een motor in een neonverlichte
steeg 's nachts, camera beweegt langzaam naar voren, 8 seconden
Referentieafbeeldingen (7):
- 3 stilstaande beelden uit Blade Runner (kleur, belichting)
- 2 cyberpunk-fotografieopnames (compositie, korrel)
- 1 productfoto van een motor (positionering van het onderwerp)
- 1 heldenframe (algemene vibe-doelstelling)
Videoreferentie (1):
- 3 seconden clip van een langzame dolly-push richting een onderwerp
Audioreferentie (1):
- 5 seconden clip van een synthdrone met subtiel regen
Resultaat:
- Stijl: sterk Blade Runner, vastgezet door de afbeeldingen
- Beweging: sluit nauwkeurig aan op de dolly-push referentie
- Sfeer: subtiele regenachtige atmosfeer dankzij de audio-aanwijzing
Totale invoer: 7 afbeeldingen + 1 video + 1 audio + 1 prompt. Generatietijd: circa 120 seconden. Uitvoer: precies wat ik wilde bij de eerste poging.
Vergelijk dat met prompt-only workflows waarbij het vaak 5-10 generaties kost om de beoogde look te benaderen. Multi-invoer bespaart iteratiekosten en sluit nauwkeuriger aan op je intentie.
Wanneer je elk invoertype toevoegt
Je hebt niet altijd alle vier nodig. Hier is wanneer elk invoertype waarde toevoegt.
Alleen tekst: Nooit. Je hebt altijd minimaal één referentietype nodig voor de Reference-modus.
Tekst + afbeeldingen: De meest gebruikelijke opzet. Werkt voor 70% van de projecten.
Tekst + afbeeldingen + video: Wanneer je specifieke beweging nodig hebt die moeilijk te beschrijven is.
Tekst + afbeeldingen + audio: Wanneer de sfeer verder moet gaan dan wat afbeeldingen alleen kunnen vastleggen.
Alle vier: Wanneer maximale nauwkeurigheid belangrijk is, zoals voor merkvideo's, heldenshots en definitieve deliverables.
Begin met tekst + afbeeldingen en voeg andere invoer toe zodra je de grenzen van die opzet bereikt.
Multi-invoer workflows voor verschillende toepassingen
Voor merkvideo's: Tekst + 6-9 merkafbeeldingen + 1-2 bewegingsreferenties met je kenmerkende camerastijl. Sla audioreferenties over tenzij je een specifiek sfeer-doel hebt.
Voor muziekvideo's: Tekst + 6-9 stijlafbeeldingen + 1 audioreferentie die aansluit bij de sfeer van het nummer. Videoreferenties zijn optioneel.
Voor storyboards: Tekst + 4-6 conceptkunstafbeeldingen + 1 bewegingsreferentie per shottype. Sla audio over.
Voor productlanceringen: Tekst + 5-7 productfoto's + 1 lifestyle/merk bewegingsreferentie. Sla audio over tenzij het product sfeerverbanden heeft.
Voor redactioneel/mode: Tekst + 6-9 lookbookfoto's + 1 loop/pose bewegingsreferentie. Sla audio over tenzij de shoot een bijbehorende soundtrack heeft.
Probeer Seedance 2.0 Reference, multimodale videogeneratie
Volledige multi-invoer controle: afbeeldingen, video en audioreferenties in één aanroep. Gratis credits, geen kaart vereist.
Probeer Seedance 2.0 Reference gratisKosten en snelheid
Multi-invoer generaties kosten hetzelfde per seconde als enkelvoudige invoer generaties: $0.3024 per seconde uitvoer. Het toevoegen van referentietypen verhoogt de kosten niet.
| Duur | Credits | Kosten |
|---|---|---|
| 4 sec | 19 | $1.90 |
| 8 sec | 37 | $3.70 |
| 15 sec | 69 | $6.90 |
Snelheid: Multi-invoer generaties duren iets langer dan tekst-only generaties, omdat het model meer invoergegevens verwerkt. Reken op 90-180 seconden voor multi-invoer aanroepen versus 60-120 seconden voor alleen-afbeelding aanroepen. Het extra wachten is bijna altijd de gewonnen nauwkeurigheid waard.
Veelgemaakte fouten bij multi-invoer
Tegenstrijdige invoer. Als je afbeeldingen zeggen "somber en langzaam" en je audio zegt "vrolijk en snel", raakt de fusie in de war. Kies invoer die het eens is over de sfeer.
Videoreferenties gebruiken voor stijl. Videoreferenties beïnvloeden alleen beweging, niet stijl. Kies ze niet op basis van hun visuele uitstraling.
Audio overbelasten. Één of twee audioreferenties is meestal voldoende. Drie kan het sfeer-signaal verzwakken.
De prompt weglaten. Zelfs met sterke referenties heb je een tekstprompt nodig voor onderwerp en actie. Een lege prompt levert generieke inhoud op.
Invoer wijzigen tussen clips in een reeks. Als je meerdere clips produceert die samenhangend moeten voelen, gebruik dan identieke referentiebundels voor alle clips.
Multi-invoer versus enkelvoudige invoer vergeleken
Hier is een vergelijking die ik uitvoerde met hetzelfde scenario.
Scenario: Korte atmosferische clip van een regenachtige stadsstraat 's nachts.
Alleen tekst poging:
Atmosferische opname van een regenachtige stadsstraat 's nachts, neonreflecties,
sombere cinematografische belichting, langzame camerapush, 5 seconden
Resultaat: Redelijk maar generiek. Kan elke noir-stijl AI-clip zijn. Gelukt bij de 4e generatie na het itereren van de prompt.
Multi-invoer poging:
- Dezelfde prompt zonder stijltaal
- 6 Blade Runner stilstaande beelden
- 1 dolly-push videoreferentie
- 1 regenachtige synth audioreferentie
Resultaat: Specifiek, vastgezet en al bij de eerste poging precies de beoogde sfeer.
Tijdsbesparing: circa 8 minuten iteratie geëlimineerd. Kostenbesparing: 3 minder generatiepogingen van elk circa $3 = circa $9 bespaard.
Vermenigvuldig dat over een project met 20+ clips en multi-invoer workflows verdienen zichzelf vele malen terug.
Multi-invoer versus standaard Seedance 2.0
Het is de moeite waard om te vermelden: standaard Seedance 2.0 is een tekst-naar-video / afbeelding-naar-video werkpaard. Het is enkelvoudige invoer. Als je alleen een prompt en één afbeelding nodig hebt, is standaard sneller in te stellen.
Multi-invoer met Seedance 2.0 Reference is voor wanneer nauwkeurigheid belangrijker is dan installatietijd. Zie het volledige Vergelijking Reference vs. Standard voor het beslissingsraamwerk.
Tips voor het voorbereiden van invoer
Afbeeldingen: 512px+ op de korte zijde, JPG of PNG, bij voorkeur uit een consistente stijlbron.
Video: 2-5 seconden per clip, elk beeldverhouding, MP4 heeft de voorkeur.
Audio: 4-10 seconden per clip, MP3 of WAV, passend bij je gewenste sfeer.
Overengineer de voorbereiding van invoer niet. Het model is vrij vergevingsgezind wat betreft resolutie, formaat en bestandsgrootte. Wat telt is de relevantie van de inhoud, niet technische perfectie.
Een multi-invoer bibliotheek opbouwen
Ervaren gebruikers bouwen een persoonlijke bibliotheek van herbruikbare invoerbestanden:
- Stijlbundels voor verschillende genres/sferen (noir, pastoraal, episch, enz.)
- Bewegingsclips voor veelvoorkomende camerabewegingen (dolly in, handgehouden, statisch, enz.)
- Audiocues voor emotionele tonen (melancholisch, hoopvol, gespannen, enz.)
Met een bibliotheek is een nieuw project starten een kwestie van bestaande invoer combineren in plaats van alles opnieuw te zoeken. Je ontwikkelt een "geluid", een herkenbare stijl die door je werk loopt omdat je invoer consistent is.
Verder gaan
Voor een praktische verdieping in de multimodale combinatie, lees multimodale AI-video. Voor de afbeeldingsspecifieke workflow, zie de tutorial voor meerdere afbeeldingen. Voor het grote overzicht van functies is de Complete gids voor Seedance 2.0 Reference de juiste keuze.
Multi-invoer is hoe AI-video precies wordt. Leer de workflow één keer en je generatiekwaliteit stijgt blijvend.
Probeer de volledige multi-invoer stack
Upload afbeeldingen, video en audioreferenties in één generatie. Gratis credits, geen kaart vereist.
Begin gratis met makenSeedance 2.0 uitproberen - Nu!
5 gratis generaties · Geen creditcard nodig