KI-Videos aus mehreren Referenzbildern erstellen
Neun Bilder, eine Generierung. Hier erfährst du genau, wie du den Multi-Image-Referenzmodus in Seedance 2.0 nutzt, um KI-Videos zu erstellen, die wirklich deiner visuellen Absicht entsprechen.

Die meisten KI-Videomodelle verarbeiten ein Bild. Seedance 2.0 Reference verarbeitet neun. Das ist kein kleiner Unterschied - es ist der Unterschied zwischen "von einem Standbild starten" und "eine ganze visuelle Sprache erben."
Dieses Tutorial behandelt den Multi-Image-Workflow: wie viele Referenzen man verwenden sollte, welche man auswählt, wie sie verschmelzen und wie man Probleme behebt, wenn die Ausgabe nicht dem entspricht, was du erwartet hast.
TL;DR
- Seedance 2.0 Reference akzeptiert bis zu 9 Bilder pro Generierung
- Mehr Bilder sind nicht immer besser - 4-6 präzise Referenzen schlagen oft 9 lockere
- Alle 9 werden in einen einzelnen "Style Vector" verschmolzen, den das Modell auf die Ausgabe anwendet
- Die Kosten betragen $0.3024/Sek. unabhängig davon, wie viele Referenzen du hochlädst
- Mehrbilder-Generierung kostenlos testen
Was passiert, wenn du 9 Bilder hochlädst
Das Modell behandelt deine 9 Bilder nicht als separate Frames. Es verschmilzt sie zu einer einzigen Style-Repräsentation - einer mathematischen Zusammenfassung ihrer gemeinsamen visuellen Attribute. Diese Zusammenfassung lenkt die Ausgabe.
Wenn deine 9 Bilder Attribute teilen (warmes Licht, geringe Tiefenschärfe, ähnliche Farbpalette), ist der verschmolzene Vector stark und spezifisch. Die Ausgabe sperrt sich auf diesen Style.
Wenn sich deine 9 Bilder widersprechen (einige warm, einige kalt, einige weit, einige nah), mittelt der verschmolzene Vector zum Generischen und der Style kommt kaum durch.
Kurierung ist wichtiger als die Anzahl.
5 kostenlose Generierungen · Keine Kreditkarte erforderlich
Wie viele Referenzen du tatsächlich verwenden solltest
| Anzahl | Wann man es verwenden sollte |
|---|---|
| 1-2 | Einzelner Hero-Frame, minimale Style-Übertragung |
| 3-4 | Klarer Style mit minimalen Variationen |
| 5-6 | Sweet Spot für die meisten Projekte |
| 7-9 | Komplexer Style mit mehreren Facetten |
Der 5-6er-Bereich ist der Platz, wo die meisten erfahrenen Benutzer landen. Es ist genug Vielfalt, um die verschiedenen Ausdrücke eines Styles zu erfassen, ohne das Signal mit Widersprüchen zu verwässern.
Gehe nur höher, wenn du wirklich mehr Facetten zu erfassen hast - beispielsweise Innenaufnahmen plus Außenaufnahmen im gleichen Filmstil. Andernfalls werden 5-6 präzise Bilder jedes Mal 9 lockere übertreffen.
Das Reference-Selection-Framework
Beim Auswählen von Referenzen decke diese Dimensionen ab:
Farbpalette. 1-2 Bilder, die deine Ziel-Farbabstufung deutlich zeigen.
Lichtrichtung. 1-2 Bilder, die zeigen, woher Licht kommt (hart/weich, hoch/tief, warm/kühl).
Komposition und Bildausschnitt. 1-2 Bilder, die deine bevorzugte Bildkonstruktion zeigen (symmetrisch, Drittelregel, eng/weit).
Textur und Körnung. 1 Bild, das das feine Detail-Gefühl erfasst (Filmkörnung, digitale Klarheit, Rausch-Muster).
Motiv-Behandlung. 1-2 Bilder, die zeigen, wie Motive normalerweise behandelt werden (isoliert, vermischt, silhouettiert).
Wenn du jede Dimension überprüfst, landest du natürlich bei 5-7 Bildern. Das ist das Ziel.

Erstelle dein erstes Multi-Image-Bündel. Wähle 5-6 Bilder, die sich auf den Style einigen und teste. Kostenlos mit 50 Credits starten.
Ein kuratiertes Beispiel
Angenommen, du wünschst dir den Look von Denis Villeneuve-Filmen - staubig, gedimmt, episch-Skala, spezifische Farbtemperaturen.
Mein Bündel:
- Breite Wüstenschuß aus Dune (Skala und Palette)
- Nahaufnahme eines Charakters in warmem Staublich (Farbtemperatur)
- Blade Runner 2049 Innenaufnahme (gedimmte Palette, Bildausschnitt)
- Arrival Nebelaufnahme (Atmosphäre und weiches Licht)
- Sicario Nachtszene (kühler Blau-Bias, Spannungs-Bildausschnitt)
- Ein Hero-Frame, der genau das Gefühl zeigt, das ich anstrebe
Sechs Bilder. Alle stimmen der Villeneuve-Ästhetik zu. Die Ausgabe wird sich hart zu diesem Look neigen, unabhängig davon, was ich in den Prompt eingebe.
Multi-Image mit Prompts kombinieren
Denk dran: Referenzen behandeln den Style. Prompts behandeln das Motiv und die Aktion.
Mit 6 starken Style-Referenzen sollte dein Prompt rein beschreibend für das sein, was passiert:
Eine Figur in einem Kapuzenmantel geht über einen riesigen Salzsee bei Sonnenuntergang,
Wind wirbelt den Stoff auf, breite Tracking-Aufnahme, 8 Sekunden
Beachte, dass es keine Style-Sprache gibt. Kein "kinematisch", kein "episch", kein "atmosphärisch". Die Referenzen sagen das bereits lauter als Worte könnten.
Wenn sich Referenzen widersprechen
Das häufigste Multi-Image-Problem ist Widerspruch. Anzeichen, dass sich deine Referenzen widersprechen:
- Ausgabefarbabstufung ist schlammig/gemittelt
- Beleuchtung fühlt sich generisch statt spezifisch an
- Style fühlt sich "KI-artig" trotz Referenzen an
- Zwei Clips mit den gleichen Referenzen erzeugen merklich unterschiedliche Looks
Behebung: Entferne die 1-2 Ausreißer-Bilder. Teste erneut. Wenn das Problem bestehen bleibt, hast du wahrscheinlich 2+ inkompatible Style-Gruppen und musst dich für eine entscheiden.
Der Debugging-Prozess: Generiere einen Test-Clip mit allen 9 Bildern. Dann generiere erneut mit der Hälfte der Bilder entfernt. Vergleiche. Die Version mit weniger Referenzen wird fast immer entscheidender aussehen.
Versuche Seedance 2.0 Reference - multimodale Video-Generierung
9 Bilder, 1 verschmolzener Style, 1 verriegeltes Video. 50 kostenlose Credits, keine Karte erforderlich.
Versuche Seedance 2.0 Reference kostenlosDas Hero-Frame-Konzept
Bezeichne unter deinen Referenzen eines als "Hero-Frame" - das einzelne Bild, das genau das Gefühl erfasst, das du möchtest. Das Modell verschmilzt alle Referenzen weiterhin gleich, aber der Hero-Frame ist dein wahrer Norden. Wenn die Ausgabe vom Gefühl des Hero-Frames abweicht, weißt du, dass etwas in den anderen Referenzen das Signal verwässert.
Denke des Hero-Frames als das Ziel und der anderen Referenzen als Kontext, der dem Modell hilft zu triangulieren. Ohne den Hero-Frame beschreibst du eine Richtung ohne ein Ziel.
Quellenmaterial anpassen
Multi-Image-Referenz ist außergewöhnlich beim Anpassen von Quellenmaterial an Video.
Eine Fotoserie anpassen: Füttere das Modell mit 5-6 Aufnahmen aus der Serie. Deine Video-Clips werden wie Fortsetzungen der Serie aussehen.
Einen Film-Style anpassen: Schnapp dir 6-8 Standfotografien von einem spezifischen Film. Deine Generierung wird sich anfühlen, als gehöre sie zu diesem Film.
Eine Brand-Visuelle Identität anpassen: Verwende die beste Marketing-Bilder der Marke als Referenzen. Die Ausgabe wird der Ästhetik der Marke entsprechen, ohne dass du sie beschreiben musst.
Concept Art anpassen: Lade die Concept Art als Referenzen hoch. Die animierte Ausgabe wird wie die Concept Art aussehen, die sich bewegt.
Die Kosten skalieren nicht mit der Bildanzahl
Es ist die Wiederholung wert: Du zahlst für die Ausgabe-Dauer, nicht für die Eingabe-Anzahl. 9 Bilder kosten das Gleiche wie 1 Bild. Der Basissatz beträgt $0.3024 pro Sekunde generierten Videos:
| Dauer | Credits | Kosten |
|---|---|---|
| 4 Sekunden | 243 | $2.42 |
| 8 Sekunden | 484 | $4.84 |
| 15 Sekunden | 907 | $9.07 |
Wenn du also im Zweifel bist, lade die zusätzliche Referenz hoch. Es ist kostenlos und wenn es dem verschmolzenen Vector hilft, gewinnst du.
Multi-Image + Motion Reference + Audio Reference
Du kannst alle drei Input-Typen in einer einzigen Generierung kombinieren. Bis zu 9 Bilder, bis zu 3 Motion-Referenzen, bis zu 3 Audio-Hinweise. Hier trennt sich Seedance 2.0 Reference wirklich von jedem anderen Modell.
Vollständiges Stack-Beispiel:
- 9 Bilder definieren eine Wes-Anderson-Ästhetik
- 1 Motion-Video zeigt einen langsamen, absichtlichen Dolly nach links
- 1 Audio-Clip einer fröhlichen Streichsektion
Plus einen minimalen Prompt: Ein Concierge öffnet die Tür eines rosa Hotels.
Die Ausgabe wird sich zu 90% wie ein Wes-Anderson-Shot anfühlen, ohne dass du "Wes Anderson" irgendwo tippen musst. Siehe unsere Multi-modale Anleitung für den Deep Dive.
Häufig gestellte Fragen
"Kann ich KI-generierte Referenzen verwenden?" Ja. Seedream Standfotografien funktionieren großartig als Reference-Input. Du kannst sogar zuerst Standfotografien generieren, die besten 6 kuratieren und dann als Referenzen für Videos verwenden.
"Müssen Referenzen das gleiche Seitenverhältnis wie die Ausgabe haben?" Nein. Das Modell extrahiert den Style unabhängig von Dimensionen.
"Kann ich ein Bündel über Projekte hinweg wiederverwenden?" Absolut. Speichere deine besten Reference-Sets und verwende sie erneut, wenn Projekte diesen Style erfordern. Siehe Stilkonsistenz-Anleitung für die Anleitung.
"Was ist, wenn ich nur 1 Reference-Bild habe?" Multi-Image-Referenz funktioniert immer noch mit 1 Bild, aber du könntest auch Standard Seedance 2.0 in Betracht ziehen, das ein einzelnes Bild direkt akzeptiert.
Deine erste Multi-Image-Generierung
Wähle einen Style, den du liebst. Sammle 5-6 Bilder, die ihn repräsentieren (von überall - Filme, Fotografie, existierende Werke, Moodboards). Lade sie zu Seedance 2.0 Reference hoch. Schreibe einen kurzen Prompt, der nur das Motiv und die Aktion beschreibt. Generiere bei 5 Sekunden.
Vergleiche die Ausgabe mit deinen Referenzen. Wenn der Style sich eingesperrt hat, hast du einen wiederholbaren Workflow. Wenn nicht, straffe dein Bündel und versuche es erneut.
In zehn Minuten wirst du wissen, wie du KI-Video produzierst, das tatsächlich wie deine Referenzen aussieht, statt wie "KI-Video".
Lade 6 Bilder hoch, erhalte 1 passendes Video
Teste Multi-Image-Referenz mit deinem eigenen Moodboard. 50 kostenlose Credits, keine Karte erforderlich.
Beginne kostenlos zu erstellenTry Seedance 2.0 - Right Now
5 free generations · No credit card needed