इस ऐप के साथ बनाया गया
OmniHuman v1.5 एक एकल पोर्ट्रेट फ़ोटो और ऑडियो फ़ाइल को पूरी तरह से एनिमेटेड टॉकिंग अवतार वीडियो में बदल देता है, जिसमें सिंक्रोनाइज़्ड लिप मूवमेंट, प्राकृतिक चेहरे की अभिव्यक्ति और भाषण के साथ मेल खाने वाले हाथों की गति शामिल होती है। आउटपुट 720p या 1080p पर एक क्लीन एमपी4 है, जो वर्चुअल प्रेजेंटर्स, ब्रांडेड प्रवक्ताओं, ई-लर्निंग नैरेटर्स और किसी भी व्यक्ति के लिए व्यावहारिक है जिन्हें कैमरा उपकरण या स्टूडियो के बिना पॉलिश्ड टॉकिंग-हेड वीडियो की आवश्यकता है।
इस ऐप का उपयोग कैसे करें
- 1
वर्णन करें कि आप क्या बनाना चाहते हैं, या अपनी सोर्स फाइल अपलोड करें।
- 2
अपने विकल्प चुनें, फिर जेनरेट दबाएं।
- 3
कुछ पलों में अपना परिणाम गैलरी में दिखाई देता हुआ देखें।
- 4
डाउनलोड करें, शेयर करें, या एक नई आइडिया के साथ फिर से जेनरेट करें।
आप क्या बना सकते हैं
वर्चुअल कोर्स प्रशिक्षक
एक प्रफेशनल हेडशॉट और रिकॉर्ड किए गए लेक्चर स्क्रिप्ट अपलोड करें ताकि एक ऑन-स्क्रीन प्रशिक्षक तैयार हो जो बोलता है, हाथों की गति करता है और स्वाभाविक रूप से प्रतिक्रिया दिखाता है। OmniHuman v1.5 चेहरे की अभिव्यक्तियों को आवाज़ के टोन के साथ संरेखित रखता है, इसलिए अवतार पूरे 60-सेकंड की ऑडियो विंडो में 720p पर रोबोटिक के बजाय लगभग-मानवीय प्रतीत होता है।
बहुभाषी उत्पाद डेमो
किसी भी भाषा में वॉयसओवर रिकॉर्ड करें, इसे एक ब्रांड-प्रतिनिधि फ़ोटो के साथ जोड़ें और मिनटों में एक स्थानीयकृत प्रवक्ता वीडियो जेनरेट करें। क्योंकि OmniHuman v1.5 भाषण की गति से हाथों की गति निकालता है, शरीर की भाषा प्रत्येक भाषा की प्राकृतिक गति के अनुसार अनुकूल होती है बिना किसी मैनुअल कीफ्रेमिंग के।
कॉर्पोरेट आंतरिक घोषणाएं
एचआर और संचार टीमें एक एकल कार्यकारी हेडशॉट को कंपनी-व्यापी वितरण के लिए एक प्रफेशनल वीडियो संदेश में बदल सकते हैं। 1080p आउटपुट विकल्प सुनिश्चित करता है कि वीडियो बड़ी स्क्रीन पर गुणवत्ता बनाए रखे, जबकि परफेक्ट लिप सिंक विश्वसनीयता बनाए रखता है जब कार्यकारी सीधे कैमरे पर दिखाई नहीं दे सकते।
सोशल मीडिया व्यक्तित्व वीडियो
कंटेंट क्रिएटर जो पर्दे के पीछे रहना पसंद करते हैं, वे एक पोर्ट्रेट से एक सुसंगत ऑन-स्क्रीन व्यक्तित्व तैयार कर सकते हैं। प्रत्येक पोस्ट के लिए स्क्रिप्ट की गई ऑडियो फीड करें और एक एमपी4 अवतार प्राप्त करें जो एक सीरीज़ में हर वीडियो में एक ही चेहरा, अभिव्यक्तियां और हाथों की गति की शैली बनाए रखे।
प्रोटोटाइप मार्केटिंग स्पॉट
लाइव शूट के लिए प्रतिबद्ध होने से पहले, मार्केटिंग टीमें स्टॉक या कॉन्सेप्ट फ़ोटो से एक यथार्थवादी प्रेजेंटर वीडियो जेनरेट करके स्क्रिप्ट और दृश्य दिशा को मान्य कर सकते हैं। 30-सेकंड 1080p सीमा विशिष्ट विज्ञापन और सोशल वीडियो फ़ॉर्मेट के साथ अच्छी तरह से मेल खाती है, जिससे समीक्षा चक्र तेज़ और सस्ते होते हैं।
आज़माने के लिए प्रॉम्प्ट आइडियाज़
क्रिएटर्स इस ऐप का उपयोग क्यों करते हैं
- एकल फोटो इनपुट
- सही लिप सिंक
- प्राकृतिक अभिव्यक्तियां
- इशारा जनरेशन
- टर्बो मोड
- 720p / 1080p आउटपुट
बेहतर परिणामों के लिए टिप्स
एक क्लीन पोर्ट्रेट चुनें
OmniHuman v1.5 एक एकल फ़ोटो से सभी एनिमेशन तैयार करता है, इसलिए छवि की गुणवत्ता मायने रखती है। एक अच्छी तरह से रोशन, आगे की ओर देखने वाला पोर्ट्रेट एक तटस्थ पृष्ठभूमि के साथ उपयोग करें। भारी फ़िल्टर, चरम कोण या आंशिक चेहरे की फसल से बचें, क्योंकि ये लिप मूवमेंट और अभिव्यक्तियों को सटीक रूप से जेनरेट करने की मॉडल की क्षमता को सीमित करते हैं।
ऑडियो लंबाई को रिजोल्यूशन के साथ मेल खाएं
ऐप 720p पर 60 सेकंड तक और 1080p पर 30 सेकंड तक समर्थन करता है। ऑडियो रिकॉर्ड करने से पहले अपनी स्क्रिप्ट को सही सीमा के अंदर फिट करने की योजना बनाएं। तथ्य के बाद ऑडियो को ट्रिम करना अक्सर अचानक समाप्ति बनाता है, इसलिए पहले अपनी नैरेशन लिखें और समय दें, फिर वह रिजोल्यूशन चुनें जो आपकी ऑडियो अवधि के अनुरूप हो।
बेहतर हाथों की गति के लिए अभिव्यक्तिपूर्ण ऑडियो का उपयोग करें
OmniHuman v1.5 में हाथों की गति की पीढ़ी ऑडियो में भाषण की गति और भावना द्वारा संचालित होती है। एक सपाट, एकरस रिकॉर्डिंग न्यूनतम गति पैदा करता है। प्राकृतिक गति, विविध जोर और स्पष्ट भावनात्मक इरादे के साथ रिकॉर्ड करें ताकि एक अधिक गतिशील, जीवंत अवतार प्राप्त हो जिसमें उपयुक्त सिर झुकाव और शरीर की गति हो।
तेजी़ पुनरावृत्ति के लिए टर्बो मोड का उपयोग करें
टर्बो मोड पीढ़ी को तेजी देता है, जिससे यह अंतिम रेंडर के लिए प्रतिबद्ध होने से पहले विभिन्न ऑडियो टेक या पोर्ट्रेट विकल्पों का परीक्षण करने के लिए आदर्श है। पहले टर्बो मोड के साथ 720p पर अपने अवतार का मसौदा तैयार करें, सत्यापित करें कि परिणाम आपकी आवश्यकताओं को पूरा करते हैं, फिर वितरण के लिए पॉलिश्ड 1080p संस्करण जेनरेट करें।
इस ऐप को कब चुनें
OmniHuman v1.5 सही विकल्प है जब यथार्थवाद और अभिव्यक्तिपूर्ण सिंक्रोनाइजेशन शीर्ष प्राथमिकताएं हैं। SadTalker की तुलना में, यह ध्यान देने योग्य रूप से अधिक प्राकृतिक चेहरे की गति और पूर्ण शरीर एनिमेशन पैदा करता है, केवल सिर गति के बजाय। Sync-3 Lipsync की तुलना में, यह एक एकल फ़ोटो से एक पूर्ण एनिमेटेड अवतार जेनरेट करता है, मौजूदा वीडियो फुटेज को इनपुट के रूप में आवश्यक किए बिना। यदि आपका लक्ष्य न्यूनतम स्रोत सामग्री से एक विश्वसनीय वर्चुअल प्रेजेंटर है, OmniHuman v1.5 लाइनअप में सबसे पूर्ण समाधान है।
अक्सर पूछे जाने वाले प्रश्न
क्या मैं फ़ोटोग्राफ के बजाय एक सचित्र या स्टाइलाइज्ड पोर्ट्रेट का उपयोग कर सकता हूं?
OmniHuman v1.5 गैर-फ़ोटोग्राफिक पोर्ट्रेट जैसे डिजिटल चित्र या रेंडरेड चरित्र एनिमेट कर सकता है, लेकिन परिणाम यथार्थवादी मानव पोर्ट्रेट के साथ सबसे विश्वसनीय हैं। अतिशयोक्तिपूर्ण अनुपात या गैर-मानव विशेषताओं वाली अत्यधिक स्टाइलाइज्ड छवियां असंगत लिप सिंक और अभिव्यक्ति सटीकता पैदा कर सकती हैं।
क्या मॉडल फ़ोटो में व्यक्ति की पहचान और उपस्थिति को संरक्षित करता है?
हां। OmniHuman v1.5 पूरे जेनरेट किए गए वीडियो में चेहरा, त्वचा का रंग, बाल और समग्र उपस्थिति को इनपुट पोर्ट्रेट के अनुरूप रखता है। यह चेहरे को बदलने के बजाय एनिमेट करता है, इसलिए अवतार मूल फ़ोटो में व्यक्ति जैसा दिखता है।
कौन से ऑडियो फॉर्मेट और गुणवत्ता के स्तर सबसे अच्छे काम करते हैं?
जबकि ऐप मानक ऑडियो फ़ाइलें स्वीकार करता है, स्पष्ट भाषण जो एक सुसंगत वॉल्यूम स्तर पर बिना पृष्ठभूमि शोर या भारी संपीड़न के रिकॉर्ड किया जाता है, सबसे सटीक लिप सिंक का उत्पादन करता है। रिवर्ब या ओवरलैपिंग आवाज़ों के साथ भारी संसाधित ऑडियो से बचें, क्योंकि ये गति का पता लगाने को भ्रमित कर सकते हैं जो हाथों की गति पीढ़ी को संचालित करता है।
क्या हाथों की गति या अभिव्यक्तियों की तीव्रता को नियंत्रित करने का कोई तरीका है?
OmniHuman v1.5 में हाथों की गति और अभिव्यक्ति की तीव्रता मैनुअल नियंत्रण के बजाय ऑडियो की भावना और गति से स्वचालित रूप से निकाली जाती है। रिकॉर्ड की गई ऑडियो की डिलीवरी, गति और अभिव्यक्तिपूर्णता को समायोजित करना अवतार को अंतिम वीडियो में कितना एनिमेटेड दिखाई देता है इसे प्रभावित करने का प्राथमिक तरीका है।
क्या अवतार किसी भी भाषा में बोल सकता है?
OmniHuman v1.5 विशिष्ट भाषा नियमों के बजाय ऑडियो तरंग और इसकी भावनात्मक सामग्री से लिप सिंक और हाथों की गति जेनरेट करता है, इसलिए यह सभी भाषाओं में काम करता है। लिप सटीकता प्रशिक्षण डेटा में कम सामान्य फोनीम पैटर्न वाली भाषाओं के लिए थोड़ी भिन्न हो सकती है, लेकिन समग्र परिणाम व्यापक रूप से बहुभाषी हैं।
अगर लिप सिंक जगहों पर थोड़ा बंद दिखाई दे तो मुझे क्या करना चाहिए?
स्पष्ट उच्चारण और थोड़ी धीमी गति के साथ ऑडियो को फिर से रिकॉर्ड करना अक्सर मामूली सिंक समस्याओं को हल करता है। आप एक पूर्ण 1080p रेंडर पर क्रेडिट खर्च करने से पहले एक वैकल्पिक ऑडियो टेक को जल्दी परीक्षण करने के लिए टर्बो मोड का भी उपयोग कर सकते हैं। मूल ऑडियो में पृष्ठभूमि शोर सिंक ड्रिफ्ट का सबसे सामान्य कारण है।
इस ऐप को कौन सा AI मॉडल संचालित करता है?
यह ऐप OmniHuman v1.5 पर चलता है, जो Arteza के माध्यम से अलग खाते या सेटअप के बिना उपलब्ध है।
क्या मैं परिणामों का व्यावसायिक रूप से उपयोग कर सकता हूं?
हां। आपके द्वारा जेनरेट किया गया कंटेंट आपका है, हमारे कंटेंट लाइसेंस के अधीन।
एक जनरेशन में कितना समय लगता है?
अधिकांश जनरेशन एक मिनट से कम समय में पूरी हो जाती हैं, और आप गैलरी में लाइव प्रगति देख सकते हैं।