كيفية إنشاء مقاطع فيديو بالذكاء الاصطناعي من صور مرجعية متعددة
تسع صور، وتوليد واحد. إليك بالضبط كيفية استخدام وضع المرجع متعدد الصور في Seedance 2.0 للحصول على مقاطع فيديو بالذكاء الاصطناعي تتطابق فعلاً مع رؤيتك البصرية.

معظم نماذج الفيديو بالذكاء الاصطناعي تقبل صورة واحدة. أما Seedance 2.0 Reference فيقبل تسعاً. هذا ليس فرقاً بسيطاً، بل هو الفرق بين «البدء من صورة ثابتة» و«توارث لغة بصرية كاملة».
يغطي هذا الدليل سير عمل الصور المتعددة: كم صورة تستخدم، وأيها تختار، وكيف تندمج معاً، وكيف تعالج المشكلات حين لا تطابق النتيجة ما توقعته.
ملخص سريع
- يقبل Seedance 2.0 Reference حتى 9 صور لكل عملية توليد
- الأكثر ليس دائماً الأفضل، فـ4-6 صور متناسقة غالباً تتفوق على 9 صور متباينة
- تُدمج الصور التسع في «متجه أسلوب» واحد يطبقه النموذج على المخرجات
- التكلفة $0.3024 في الثانية بصرف النظر عن عدد الصور التي ترفعها
- جرّب توليد صور متعددة مجاناً
ما الذي يحدث حين ترفع 9 صور
النموذج لا يعامل صورك التسع كإطارات منفصلة، بل يدمجها في تمثيل أسلوبي واحد، وهو ملخص رياضي لسماتها البصرية المشتركة، ثم يستخدم هذا الملخص لتوجيه المخرجات.
إذا كانت صورك التسع تتشارك سمات مشتركة كالإضاءة الدافئة وضحالة عمق المجال وتناسق الألوان، فسيكون المتجه المدمج قوياً ومحدداً، وستلتزم المخرجات بذلك الأسلوب.
أما إذا تعارضت صورك التسع، بعضها دافئ وبعضها بارد، وبعضها واسع وبعضها مقرّب، فسيتجه المتجه المدمج نحو المتوسط العام وسيكاد الأسلوب يختفي من المخرجات.
الاختيار الدقيق أهم من العدد.
5 عمليات إنشاء مجانية · لا يوجد طلب لبطاقة ائتمان
كم صورة مرجعية تستخدم فعلاً
| العدد | متى تستخدمه |
|---|---|
| 1-2 | إطار رئيسي واحد، نقل أسلوب محدود |
| 3-4 | أسلوب واضح مع تباين بسيط |
| 5-6 | النطاق المثالي لمعظم المشاريع |
| 7-9 | أسلوب معقد بجوانب متعددة |
يستقر معظم المستخدمين المتمرسين عند نطاق 5-6 صور. فهو يوفر تنوعاً كافياً لالتقاط تعبيرات الأسلوب المختلفة دون تخفيف الإشارة بالتناقضات.
ارفع العدد فقط حين يكون لديك جوانب إضافية حقيقية لالتقاطها، كلقطات داخلية ولقطات خارجية بالأسلوب السينمائي ذاته مثلاً. وإلا فإن 5-6 صور متناسقة ستتفوق على 9 صور متباينة في كل مرة.
إطار اختيار الصور المرجعية
عند اختيار صورك المرجعية، غطِّ هذه الأبعاد:
لوحة الألوان. 1-2 صورة تُظهر بوضوح درجة الألوان المستهدفة.
اتجاه الإضاءة. 1-2 صورة تُظهر مصدر الضوء، سواء كان قاسياً أو ناعماً، علوياً أو سفلياً، دافئاً أو بارداً.
التكوين والتأطير. 1-2 صورة تُظهر بناء اللقطة المفضل لديك، سواء كان متماثلاً أو وفق قاعدة الأثلاث، ضيقاً أو واسعاً.
الملمس والحبيبية. صورة واحدة تلتقط الإحساس بالتفاصيل الدقيقة، سواء كانت حبيبية فيلمية أو نظافة رقمية أو نمط ضوضاء.
معالجة الموضوع. 1-2 صورة تُظهر كيف تُعالج الموضوعات عادةً، سواء كانت معزولة أو ممزوجة أو في صورة ظلية.
إذا غطيت كل بُعد، ستصل بشكل طبيعي إلى 5-7 صور. وهذا هو الهدف.

ابنِ أول مجموعة صور متعددة. اختر 5-6 صور تتفق على الأسلوب واختبرها. ابدأ مجاناً بـ 10 رصيد.
مثال مُنتقى بعناية
لنفترض أنك تريد مظهر أفلام Denis Villeneuve، ذلك الأسلوب الغباري المكتوم ذو المقياس الملحمي ودرجات الحرارة اللونية المميزة.
مجموعتي:
- لقطة صحراوية واسعة من Dune (المقياس ولوحة الألوان)
- لقطة مقربة لشخصية في ضوء غبار دافئ (درجة حرارة اللون)
- لقطة داخلية من Blade Runner 2049 (لوحة ألوان مكتومة وتأطير)
- لقطة ضباب من Arrival (الجو والضوء الناعم)
- مشهد ليلي من Sicario (ميل أزرق بارد وتأطير التوتر)
- إطار رئيسي واحد يُظهر الإحساس الدقيق الذي أسعى إليه
ست صور. جميعها تتفق على الجمالية الخاصة بـ Villeneuve. ستنحاز المخرجات بشدة نحو ذلك المظهر بصرف النظر عما أكتبه في الوصف.
الجمع بين الصور المتعددة والأوصاف النصية
تذكر: الصور المرجعية تتولى الأسلوب. الأوصاف النصية تتولى الموضوع والحركة.
مع 6 صور مرجعية أسلوبية قوية، يجب أن يكون وصفك النصي وصفاً خالصاً لما يحدث:
شخصية ترتدي عباءة بغطاء رأس تسير عبر سهل ملحي شاسع عند الغروب،
الريح تُحرك القماش، لقطة تتبع واسعة، 8 ثوانٍ
لاحظ أنه لا توجد أي لغة أسلوبية. لا «سينمائي»، ولا «ملحمي»، ولا «جوي». الصور المرجعية تقول كل ذلك بصوت أعلى مما تستطيع الكلمات.
حين تتعارض الصور المرجعية
أكثر مشكلات الصور المتعددة شيوعاً هي التناقض. علامات تعارض صورك المرجعية:
- درجة ألوان المخرجات موحلة أو متوسطة
- الإضاءة تبدو عامة بدلاً من أن تكون محددة
- الأسلوب يبدو «ذكاءً اصطناعياً» رغم وجود الصور المرجعية
- مقطعان بالصور المرجعية ذاتها ينتجان مظهرين مختلفين بشكل ملحوظ
الحل: أزل 1-2 صورة شاذة. اختبر مجدداً. إذا استمرت المشكلة، فمن المرجح أن لديك مجموعتين أو أكثر من الأساليب غير المتوافقة وتحتاج إلى الالتزام بواحدة.
عملية التشخيص: أنشئ مقطع اختبار بالصور التسع كلها. ثم أنشئ مجدداً مع حذف نصف الصور. قارن النتيجتين. النسخة ذات الصور الأقل ستبدو دائماً تقريباً أكثر حسماً.
جرّب Seedance 2.0 Reference لتوليد الفيديو متعدد الوسائط
9 صور، أسلوب مدمج واحد، فيديو محكم واحد. رصيد مجاني، لا بطاقة مطلوبة.
جرّب Seedance 2.0 Reference مجاناًمفهوم الإطار الرئيسي
من بين صورك المرجعية، حدد إطاراً رئيسياً واحداً، وهو الصورة الوحيدة التي تلتقط بدقة الإحساس الذي تريده. النموذج لا يزال يدمج جميع الصور المرجعية بالتساوي، لكن الإطار الرئيسي هو نجمك القطبي. إذا ابتعدت المخرجات عن إحساس الإطار الرئيسي، فأنت تعلم أن شيئاً ما في الصور الأخرى يُخفف الإشارة.
فكر في الإطار الرئيسي باعتباره الهدف، وفي الصور المرجعية الأخرى باعتبارها السياق الذي يساعد النموذج على تحديد موقعه. بدون الإطار الرئيسي، أنت تصف اتجاهاً دون وجهة.
مطابقة المواد المصدرية
المرجع متعدد الصور استثنائي لتكييف المواد المصدرية مع الفيديو.
تكييف سلسلة صور: أدخل للنموذج 5-6 لقطات من السلسلة. ستبدو مقاطع الفيديو الخاصة بك كامتداد للسلسلة.
تكييف أسلوب فيلم: احصل على 6-8 لقطات ثابتة من فيلم محدد. سيبدو ما تولده كأنه ينتمي إلى ذلك الفيلم.
تكييف الهوية البصرية لعلامة تجارية: استخدم أفضل صور التسويق للعلامة التجارية كمراجع. ستتطابق المخرجات مع جمالية العلامة التجارية دون الحاجة إلى وصفها.
تكييف الرسوم التصورية: ارفع الرسوم التصورية كمراجع. ستبدو المخرجات المتحركة كأن الرسوم التصورية تتحرك.
التكلفة لا تتضاعف مع عدد الصور
يستحق التكرار: أنت تدفع مقابل مدة المخرجات، لا مقابل عدد المدخلات. 9 صور تكلف مثل صورة واحدة. السعر الأساسي هو $0.3024 في الثانية من الفيديو المولَّد:
| المدة | الرصيد | التكلفة |
|---|---|---|
| 4 ثوانٍ | 19 | $1.90 |
| 8 ثوانٍ | 37 | $3.70 |
| 15 ثانية | 69 | $6.90 |
لذا عند الشك، ارفع الصورة المرجعية الإضافية. إنها مجانية، وإن أسهمت في تحسين المتجه المدمج فأنت الرابح.
الصور المتعددة ومرجع الحركة ومرجع الصوت
يمكنك الجمع بين أنواع المدخلات الثلاثة في عملية توليد واحدة: حتى 9 صور، وحتى 3 مراجع حركة، وحتى 3 إشارات صوتية. هنا يتميز Seedance 2.0 Reference حقاً عن كل نموذج آخر.
مثال على المجموعة الكاملة:
- 9 صور تحدد جمالية Wes Anderson
- مقطع حركة واحد يُظهر حركة دولي بطيئة ومتأنية نحو اليسار
- مقطع صوتي واحد لقسم وتريات خفيف
بالإضافة إلى وصف نصي مختصر: موظف استقبال يفتح باب فندق وردي اللون.
ستبدو المخرجات بنسبة 90% كلقطة من أفلام Wes Anderson دون أن تكتب «Wes Anderson» في أي مكان. راجع دليل متعدد الوسائط للتعمق في التفاصيل.
أسئلة شائعة
«هل يمكنني استخدام صور مولَّدة بالذكاء الاصطناعي كمراجع؟» نعم. الصور الثابتة من Seedream تعمل بشكل ممتاز كمدخلات مرجعية. يمكنك حتى توليد صور ثابتة أولاً، ثم اختيار أفضل 6 منها، واستخدامها كمراجع للفيديو.
«هل يجب أن تكون الصور المرجعية بنسبة عرض إلى ارتفاع مطابقة للمخرجات؟» لا. النموذج يستخرج الأسلوب بشكل مستقل عن الأبعاد.
«هل يمكنني إعادة استخدام مجموعة صور عبر مشاريع مختلفة؟» بالتأكيد. احفظ أفضل مجموعات مراجعك وأعد استخدامها حين تستدعي المشاريع ذلك الأسلوب. راجع دليل الاتساق في الأسلوب لمعرفة الكيفية.
«ماذا لو كان لدي صورة مرجعية واحدة فقط؟» المرجع متعدد الصور يعمل أيضاً مع صورة واحدة، لكن قد تفكر أيضاً في Standard Seedance 2.0 الذي يقبل صورة واحدة مباشرة.
أول توليد لك بصور متعددة
اختر أسلوباً تحبه. اجمع 5-6 صور تمثله، من أي مصدر كان، أفلام أو تصوير فوتوغرافي أو أعمال موجودة أو لوحات مزاجية. ارفعها إلى Seedance 2.0 Reference. اكتب وصفاً قصيراً يصف الموضوع والحركة فقط. ولِّد مقطعاً بمدة 5 ثوانٍ.
قارن المخرجات بصورك المرجعية. إذا التزم الأسلوب، فلديك سير عمل قابل للتكرار. وإن لم يلتزم، فشدد مجموعتك وحاول مجدداً.
بعد عشر دقائق من الآن، ستعرف كيف تنتج فيديو بالذكاء الاصطناعي يبدو فعلاً كصورك المرجعية بدلاً من أن يبدو كـ«فيديو ذكاء اصطناعي».
ارفع 6 صور واحصل على فيديو متطابق
اختبر المرجع متعدد الصور بلوحتك المزاجية الخاصة. رصيد مجاني، لا بطاقة مطلوبة.
ابدأ الإنشاء مجاناًجرّب Seedance 2.0 - الآن
5 عمليات إنشاء مجانية · لا يوجد طلب لبطاقة ائتمان