Multi-modal AI-video: kombiner billeder, video og lyd med Arteza
Ægte multi-modal AI-video betyder at give modellen mere end bare en prompt. Her kan du se, hvordan du kombinerer billeder, video og lydreferencer i Seedance 2.0 Reference.

"Multi-modal" bruges løst i AI-markedsføring. De fleste værktøjer, der påstår det, mener egentlig "vi accepterer tekst og ét billede." Seedance 2.0 Reference er en af de få modeller, der tager begrebet seriøst: op til 9 billeder, 3 videoklip og 3 lydklip, alt sammen fusioneret til én enkelt generering.
Her er, hvordan du faktisk bruger alle tre inputtyper sammen, og hvorfor kombinationen åbner muligheder, som intet enkelt input kan.
TL;DR
- Seedance 2.0 Reference accepterer billeder + video + lyd som reference i ét kald
- Billeder styrer stil, video styrer bevægelse, lyd styrer stemning
- Kombinationen af alle tre giver mere præcist output end én enkelt inputtype
- Pris: $0,3024/sek., uanset hvor mange referencer du bruger
- Generering: 60-180 sekunder for den fusionerede multi-modal-pipeline
- Prøv den fulde multimodale stak gratis
Hvad hver inputtype faktisk styrer
Disse tre referencetyper overlapper ikke, de håndterer forskellige dimensioner af outputtet.
Billeder styrer stil. Farvepalet, belysning, komposition, tekstur og indramning. Alt det visuelle, der ikke involverer bevægelse.
Video styrer bevægelse. Kamerabevægelser, tempo, handlingsvektorer og tidsmæssig rytme. Ikke farve eller belysning, modellen udtrækker bevægelse uafhængigt af videoens visuelle stil.
Lyd styrer stemning. En følelsesmæssig bias, der påvirker det visuelle output subtilt. Ikke den lyd, du hører i outputtet (den genereres separat), men det stemningssignal, der påvirker, hvad der vises på skærmen.
Når du bruger alle tre sammen, udfylder hver enkelt et hul, som de andre ikke kan.
5 gratis generationer · Intet kreditkort påkrævet
Stakken i praksis
Her er en konkret multi-modal generering, jeg kørte.
Mål: Et drømmende slowmotion-shot af en kvinde, der løber gennem en mark ved daggry, i stil med en Terrence Malick-film.
Billedreferencer (6):
- 2 Malick-filmstills med varmt daggrylys
- 2 billeder af marker i gyldent lys
- 1 shot med præcis den objektivkarakter, jeg ønskede (blød, drømmende bokeh)
- 1 hero-frame med den præcise stemning
Videoreferencer (1):
- Et 3-sekunders klip af en slowmotion-løbende figur optaget med en lang linse
Lydreferencer (1):
- 4 sekunder med blid, sparsom klaver
Prompt:
A woman in a white dress runs through tall grass at dawn, 8 seconds
Læg mærke til, hvor minimal prompten er. Referencerne håndterer alt det øvrige.
Outputtet var overraskende tæt på hensigten: stilen kom fra billederne, den specifikke slowmotion-løbefornemmelse kom fra videoen, og en subtil følelsesmæssig tyngde kom fra lyden, som jeg ikke kunne have opnået med kun billeder.

Prøv den fulde multi-modal-stak. Upload billeder, et bevægelsesklip og en lydreferance i ét kald. Start gratis med 10 credits.
Billedreferencer: fundamentet
Billeder er det tungeste input i fusionen. De bør altid være din primære stilkanal. Brug mindst 4-6, op til 9 ved komplekse stilarter.
Se den dedikerede tutorial med flere billeder for den fulde metodik til billedudvælgelse. Kort sagt: overensstemmelse betyder mere end antal, dæk forskellige facetter af stilen, og inkluder én hero-frame.
Videoreferencer: bevægelseslag
Videoreferencer er der, hvor multi-modal virkelig adskiller sig fra rent billedbaserede arbejdsgange. At beskrive kamerabevægelse med ord er genuint svært, "et langsomt handheld-drift til venstre mens der subtilt kranes op" mister præcision, hver gang du oversætter det til prosa.
En 2-5 sekunders videoreference springer oversættelsen over. Modellen samples bevægelsesvektorer direkte.
Bedste anvendelser:
- Specifik handheld-fornemmelse, du vil matche
- Vanskelige kamerabevægelser (craning, dolly + pan-kombinationer, whip-overgange)
- Temposignaler (fornemmelsen af hurtige klip kontra langsom kontemplativ stil)
- Handlingsrytme til sports- eller danceindhold
Hvad videoreferencer ikke gør:
- De bærer ikke deres egen stil. Farvegradering fra referencen overføres ikke, kun bevægelse.
- De dikterer ikke indhold. Motivet i referencen optræder ikke i dit output.
Du kan bruge op til 3 videoreferencer pr. generering. Stabling af flere bevægelsesreferencer blander dem, nyttigt hvis du vil finde noget "midt imellem" to referencebevægelser.
Lydreferencer: stemningslaget
Lydreferencer er den mærkeligste af de tre. De optræder ikke i dit outputs lydspor (det genereres nyt, så det matcher scenen). I stedet påvirker de visualerne følelsesmæssigt.
En stormfuld lydreference trækker mod dramatisk belysning og mørkere farvepalette. En munter uptempo-reference trækker mod lysere indramning og mere bevægelse. En sparsom melankolsk reference trækker mod længere, langsommere shots med koldere toner.
Hvornår du bør bruge dem:
- Stilreferencerne og prompten er solide, men outputtet føles følelsesmæssigt fladt
- Du ønsker en stemning, der er svær at beskrive visuelt
- Du matcher output til et eksisterende musikstykke eller en sang
Hvornår du bør springe dem over:
- Dine første par genereringer. Start kun med billeder. Tilføj lydreferencer, når du er fortrolig med basislinjen.
Op til 3 lydreferencer pr. generering, blandet sammen.
Prøv Seedance 2.0 Reference, multi-modal videogenerering
Kombiner billeder, video og lydreferencer i én generering. Gratis credits, intet kort kræves.
Prøv Seedance 2.0 Reference gratisBeslutningstræet for multi-modal
Ikke alle projekter har brug for alle tre inputs. Her er, hvornår du bør tilføje hvert enkelt:
Altid: Billedreferencer (mindst 3) Tilføj videoreference hvis: Du har brug for specifik bevægelse, der er svær at beskrive Tilføj lydreference hvis: Dit output føles følelsesmæssigt skævt efter forsøg med kun billeder
Tving ikke multi-modal, når en enklere stak fungerer. Billede-only-genereringer er hurtigere at sætte op og ofte tilstrækkelige.
Typiske fejl med multi-modal
At modarbejde billederne med videoen. Hvis dine billeder er stemningsfulde og langsomme, men din videoreference er hurtig og lys, bliver fusionen forvirret. Vælg inputs, der er enige.
At bruge videoreferencer til stil. De er kun til bevægelse. Stil kommer stadig fra billeder.
At overbruge lydreferencer. Et enkelt præcist lydcue er mere effektivt end 3 modstridende.
At springe prompten over. Referencer definerer hvordan, prompten definerer stadig hvad. Lad ikke prompten stå tom.
Pris og generingstid
Multi-modal-prisen er identisk med ethvert andet Reference-mode-kald: $0,3024 pr. sekund output. Det koster ikke ekstra at tilføje video- og lydreferencer.
| Varighed | Credits | Pris |
|---|---|---|
| 4 sek. | 19 | $1,90 |
| 8 sek. | 37 | $3,70 |
| 15 sek. | 69 | $6,90 |
Generingstiden er lidt længere end ved billede-only, fordi fusionen behandler mere data. Forvent 90-180 sekunder for multi-modal-kald mod 60-120 sekunder for billede-only.
En fuld multi-modal produktionsworkflow
For et projekt med 10 klip, hvor hvert klip skal matche hinanden:
1. Byg din referencepakke (én gang, genbruges til alle 10 klip):
- 6 billeder, der definerer stilen
- 2 videoreferencer til dine mest brugte kamerabevægelser
- 1 lydreference til den følelsesmæssige tone
2. Skriv 10 shot-specifikke prompts, der kun beskriver motiv og handling.
3. Kør alle 10 genereringer med samme referencepakke, og varér kun prompten.
4. Gennemse og iterér på de klip, der er driftet. Typisk 1-2 ud af 10.
Samlet pris for 10 klip à 8 sekunder: ca. 4.840 credits = ca. $48. Det er inden for $50 Pro-niveau med lidt tilovers.
Sammenligning: multi-modal vs. standard
| Funktion | Standard Seedance 2.0 | Reference (multi-modal) |
|---|---|---|
| Stilkontrol | Kun prompt | Op til 9 billeder |
| Bevægelseskontrol | Kun prompt | Op til 3 videoreferencer |
| Stemningskontrol | Kun prompt | Op til 3 lydreferencer |
| Opsætningskompleksitet | Lav | Moderat |
| Outputpræcision | Moderat | Høj |
| Bedst til | Enkeltstående idéer | Præcisionsarbejde |
Standard er hurtigere til enkle idéer. Reference multi-modal er præcisionsvalget, når du har brug for, at outputtet matcher en specifik hensigt. Se den fulde Sammenligning af Reference vs. Standard.
Avanceret: lagdeling af referencer på tværs af en sekvens
Til multi-shot-sekvenser med adskilte øjeblikke kan du ændre din multi-modal-stak mellem shots, mens du holder ét element konstant.
Konstant på tværs af sekvensen: 5-6 stilbilleder (for visuel sammenhæng) Variabel pr. shot: 1-2 shot-specifikke billeder + 1 bevægelsesreference
De konstante billeder binder sekvensen sammen. De variable referencer giver dig mulighed for at fange shot-specifik nuance. Det er den workflow, de fleste professionelle brugere ender med.
Hvad du gør herfra
Hvis dette er din første gang med multi-modal, så start småt. Prøv billede-only-genereringer først (tutorial med flere billeder). Når du er fortrolig, tilføjer du en bevægelsesreference. Når du får pålidelige resultater, eksperimenterer du med lyd.
For det komplette funktionsoverblik kan du læse Seedance 2.0 Reference-guide. For specifikke use cases kan du se brandvideoer eller musikvideoer.
Multi-modal er ikke et gimmick, det er den funktion, der adskiller Seedance 2.0 Reference fra alle andre AI-videoværktøjer på markedet. Brug det, når præcision betyder noget.
Stak billeder, video og lyd i ét kald
Se, hvordan multi-modal input låser dit AI-videooutput fast. Gratis credits, intet kort kræves.
Begynd at skabe gratisPrøv Seedance 2.0 - Lige nu
5 gratis generationer · Intet kreditkort påkrævet