اس ایپلیکیشن کے ساتھ بنایا گیا
OmniHuman v1.5 ایک پورٹریٹ فوٹو اور آڈیو فائل کو مکمل طور پر متحرک بات کرنے والے اوتار کی ویڈیو میں تبدیل کرتا ہے، جس میں ہم آہنگ ہونٹوں کی حرکت، قدرتی چہرے کے تاثرات، اور الفاظ سے مطابقت رکھنے والے اشارے شامل ہوتے ہیں۔ آؤٹ پٹ 720p یا 1080p میں صاف ایم پی 4 فارمیٹ میں ہے، جو ورچوئل پریزنٹرز، برانڈڈ ترجمان، ای لرننگ ناریٹرز، اور ہر اس شخص کے لیے موزوں ہے جسے کیمرہ یا سٹوڈیو کے بغیر پالش شدہ ٹاکنگ ہیڈ ویڈیو درکار ہو۔
اس ایپلیکیشن کو کیسے استعمال کریں
- 1
بیان کریں کہ آپ کیا بنانا چاہتے ہیں، یا اپنی ذریعہ فائل اپ لوڈ کریں۔
- 2
اپنے اختیارات منتخب کریں، پھر بنائیں دبائیں۔
- 3
اپنی نتیجہ گیلری میں لمحوں میں ظاہر ہوتے دیکھیں۔
- 4
ڈاؤن لوڈ کریں، شیئر کریں، یا نئے خیال کے ساتھ دوبارہ بنائیں۔
آپ کیا بنا سکتے ہیں
ورچوئل کورس انسٹرکٹرز
ایک پروفیشنل ہیڈ شاٹ اور ریکارڈ شدہ لیکچر اسکرپٹ اپ لوڈ کریں تاکہ آن سکرین انسٹرکٹر حاصل ہو جو بات کرے، اشارے کرے، اور قدرتی طریقے سے رد عمل ظاہر کرے۔ OmniHuman v1.5 چہرے کے تاثرات کو صوتی لہجے کے ساتھ ہم آہنگ رکھتا ہے تاکہ اوتار 720p میں 60 سیکنڈ کی مکمل آڈیو ونڈو میں حقیقی لگے، مکینیکی نہیں۔
کثیر لسانی مصنوعات کی پریزنٹیشن
کسی بھی زبان میں ایک آواز کا ریکارڈنگ کریں، اسے ایک برانڈ نمائندے کی فوٹو کے ساتھ جوڑیں، اور منٹوں میں مقامی شدہ ترجمان کی ویڈیو تیار کریں۔ چونکہ OmniHuman v1.5 اشارے کو تقریر کی رفتار سے حاصل کرتا ہے، جسم کی زبان ہر زبان کی قدرتی رفتار میں ڈھل جاتی ہے بغیر کسی دستی کیفریمنگ کے۔
کارپوریٹ اندرونی اعلانات
انسانی وسائل اور کمیونیکیشنز ٹیمز ایک سنگل ایگزیکٹو ہیڈ شاٹ کو کمپنی کی وسیع تقسیم کے لیے پروفیشنل ویڈیو پیغام میں تبدیل کر سکتے ہیں۔ 1080p آؤٹ پٹ آپشن بڑی سکرینوں پر ویڈیو کے معیار کو برقرار رکھتا ہے، جبکہ بہترین ہونٹوں کی ہم آہنگی اعتبار برقرار رکھتی ہے جب ایگزیکٹو براہ راست کیمرہ میں نہیں آ سکتا۔
سوشل میڈیا شخصیت کی ویڈیوز
کمنٹ کریٹرز جو پردے کے پیچھے رہنے کو ترجیح دیتے ہیں وہ ایک پورٹریٹ سے مطابقت پذیر آن سکرین شخصیت بنا سکتے ہیں۔ ہر پوسٹ کے لیے اسکرپٹ شدہ آڈیو ڈالیں اور ایک ایم پی 4 اوتار موصول کریں جو سلسلے کی ہر ویڈیو میں ایک جیسے چہرے، تاثرات، اور اشاری انداز برقرار رکھے۔
پروٹو ٹائپ مارکیٹنگ اسپاٹس
براہ راست شوٹ میں منسلک ہونے سے پہلے، مارکیٹنگ ٹیمز اسٹاک یا تصور کی فوٹو سے حقیقی پائے جانے والے پریزنٹر کی ویڈیو تیار کر کے اسکرپٹس اور بصری سمت کی تصدیق کر سکتے ہیں۔ 30 سیکنڈ کی 1080p حد عام اشتہار اور سوشل ویڈیو فارمیٹس کے ساتھ اچھی طریقے سے میل کھاتی ہے، جس سے جائزے کے سائیکلز تیز اور سستے ہو جاتے ہیں۔
آزمانے کے لیے Prompt کے خیالات
کریٹرز اس ایپلیکیشن کو کیوں استعمال کرتے ہیں
- واحد تصویر کا ان پٹ
- مکمل لب سنک
- قدرتی تاثیریں
- حرکت کی نسل
- ٹربو موڈ
- 720p/1080p آؤٹ پٹ
بہتر نتائج کے لیے تجاویز
صاف پورٹریٹ منتخب کریں
OmniHuman v1.5 ایک فوٹو سے تمام متحرک حصہ بناتا ہے، لہذا تصویر کا معیار اہم ہے۔ اچھی روشنی والی، سامنے کی طرف منہ کی پورٹریٹ استعمال کریں جس میں غیر جانبدار پس منظر ہو۔ بھاری فلٹرز، انتہائی زاویے، یا جزوی چہرے کی کاٹ سے بچیں، کیونکہ یہ ہونٹوں کی حرکت اور تاثرات کی درست تیاری کو محدود کرتے ہیں۔
آڈیو کی لمبائی کو ریزولوشن سے میل کھائیں
ایپ 720p میں 60 سیکنڈ تک اور 1080p میں 30 سیکنڈ تک معاون ہے۔ آڈیو ریکارڈ کرنے سے پہلے اپنی اسکرپٹ کو درست حد میں ڈھالیں۔ اسکرپٹ کے بعد آڈیو کاٹنا اکثر ختم ہونے میں اچانک کمی لاتا ہے، لہذا پہلے اپنی تقریر لکھیں اور ٹائم کریں، پھر وہ ریزولوشن منتخب کریں جو آپ کے آڈیو کی مدت کے مطابق ہو۔
بہتر اشاروں کے لیے بیان کرتے ہوئے صوت استعمال کریں
OmniHuman v1.5 میں اشارہ تیاری صوتی تقریر کی رفتار اور آڈیو میں جذبات سے چلائی جاتی ہے۔ ایک فلیٹ، یکسو ریکارڈنگ کم حرکت پیدا کرتی ہے۔ قدرتی رفتار، متنوع زور، اور صاف جذباتی مقصد کے ساتھ ریکارڈ کریں تاکہ زیادہ متحرک، حقیقی اوتار ملے جس میں مناسب سر کی حرکت اور جسم کے اشارے ہوں۔
تیز پُنروہاب کے لیے ٹربو موڈ استعمال کریں
ٹربو موڈ نسل کو تیز کرتا ہے، جو مختلف آڈیو ٹیکس یا پورٹریٹ کے انتخابات کو آزمانے کے لیے بہترین ہے آخری رینڈر میں منسلک ہونے سے پہلے۔ ٹربو موڈ کے ساتھ اپنی اوتار کو پہلے 720p میں ڈرافٹ کریں، تصدیق کریں کہ نتیجہ آپ کی ضروریات کو پورا کرتا ہے، پھر تقسیم کے لیے پالش شدہ 1080p ورژن تیار کریں۔
اس ایپ کو کب منتخب کریں
OmniHuman v1.5 صحیح انتخاب ہے جب حقیقیت اور بیان کرتے ہوئے ہم آہنگی اہم ترجیحات ہوں۔ SadTalker کے مقابلے میں، یہ نمایاں طور پر زیادہ قدرتی چہرے کی حرکت اور مکمل اشاری متحرک حصہ تیار کرتا ہے نہ کہ صرف سر کی حرکت۔ Sync-3 Lipsync کے مقابلے میں، یہ موجودہ ویڈیو فوٹیج کے ان پٹ کے بجائے ایک فوٹو سے مکمل متحرک اوتار تیار کرتا ہے۔ اگر آپ کا مقصد کم ذریعے کے مواد سے قابل اعتماد ورچوئل پریزنٹر حاصل کرنا ہے، تو OmniHuman v1.5 لائن اپ میں سب سے مکمل حل ہے۔
اکثر پوچھے جانے والے سوالات
کیا میں فوٹوگراف کی جگہ ایک کارٹوں شدہ یا انداز شدہ پورٹریٹ استعمال کر سکتا ہوں؟
OmniHuman v1.5 غیر فوٹوگرافی پورٹریٹس جیسے ڈیجیٹل رسومات یا رینڈر شدہ کریکٹرز کو متحرک کر سکتا ہے، لیکن نتائج حقیقی انسانی پورٹریٹس کے ساتھ سب سے قابل اعتماد ہیں۔ بہت زیادہ انداز شدہ تصویریں اضافہ شدہ تناسبات یا غیر انسانی خصوصیات کے ساتھ نامعلوم ہونٹوں کی ہم آہنگی اور تاثرات کی درستگی تیار کر سکتی ہیں۔
کیا ماڈل فوٹو میں شخص کی شناخت اور ظہور برقرار رکھتا ہے؟
ہاں۔ OmniHuman v1.5 منتج شدہ ویڈیو میں پورے چہرے، جلد کا رنگ، بالوں، اور مجموعی ظہور کو ان پٹ پورٹریٹ کے ساتھ برقرار رکھتا ہے۔ یہ چہرے کو بدلنے کی بجائے چہرے کو متحرک کرتا ہے، لہذا اوتار اصل فوٹو میں شخص کی طرح لگتا ہے۔
کون سے آڈیو فارمیٹس اور معیار کی سطحیں سب سے بہتر کام کرتی ہیں؟
اگرچہ ایپ معیاری آڈیو فائلوں کو قبول کرتا ہے، صاف تقریر جو مسلسل حجم کی سطح پر ریکارڈ شدہ ہو پس منظر کی شور یا بھاری کمپریشن کے بغیر سب سے درست ہونٹوں کی ہم آہنگی دیتی ہے۔ بھاری طریقے سے پروسیس شدہ آڈیو سے بچیں جس میں الٹی ہوئی یا آرتی شدہ آوازیں ہوں، کیونکہ یہ رفتار کی شناخت کو الجھا سکتے ہیں جو اشاریوں کو متحرک کرتی ہے۔
کیا اشاروں یا تاثرات کی شدت کو کنٹرول کرنے کا کوئی طریقہ ہے؟
OmniHuman v1.5 میں اشارہ اور تاثرات کی شدت خود بخود آڈیو کے جذبے اور رفتار سے حاصل کی جاتی ہے بجائے دستی کنٹرولز کے۔ ریکارڈ شدہ آڈیو کی ترسیل، رفتار، اور بیان کرتے ہوئے کو ڈھالنا اوتار کو آخری ویڈیو میں کتنا متحرک لگتا ہے، یہ متاثر کرنے کا بنیادی طریقہ ہے۔
کیا اوتار کسی بھی زبان میں بات کر سکتا ہے؟
OmniHuman v1.5 ہونٹوں کی ہم آہنگی اور اشارے آڈیو لہر اور اس کے جذباتی مواد سے تیار کرتا ہے بجائے معین زبان کے اصولوں کے، لہذا یہ زبانوں میں کام کرتا ہے۔ ہونٹوں کی درستگی ان زبانوں کے لیے تھوڑا سا مختلف ہو سکتی ہے جن کی فونیم شالیں تربیت کے ڈیٹا میں کم عام ہیں، لیکن مجموعی نتائج وسیع طور پر کثیر لسانی ہیں۔
اگر ہونٹوں کی ہم آہنگی جگہ جگہ تھوڑی آف لگے تو مجھے کیا کرنا چاہیے؟
صاف تلفظ اور قدرے سست رفتار کے ساتھ آڈیو دوبارہ ریکارڈ کرنا اکثر معمولی ہم آہنگی کے مسائل کو حل کرتا ہے۔ آپ ٹربو موڈ کے ذریعے متبادل آڈیو ٹیک کو جلدی آزمانے کے لیے استعمال کر سکتے ہیں مکمل 1080p رینڈر میں جانے سے پہلے۔ اصل آڈیو میں پس منظر کی شور ہم آہنگی کی نقل کا سب سے عام سبب ہے۔
کون سا AI ماڈل اس ایپلیکیشن کو طاقتور بناتا ہے؟
یہ ایپ OmniHuman v1.5 پر چلتی ہے، جو Arteza کے ذریعے دستیاب ہے بغیر کسی الگ اکاؤنٹ یا سیٹ اپ کے۔
کیا میں نتائج کو تجارتی طور پر استعمال کر سکتا ہوں؟
جی ہاں۔ جو مواد آپ بناتے ہیں وہ آپ کا ہے استعمال کے لیے، ہماری مواد لائسنسز کے لحاظ سے۔
جنریشن میں کتنا وقت لگتا ہے؟
زیادہ تر جنریشنز ایک منٹ سے کم میں مکمل ہو جاتی ہیں، اور آپ گیلری میں لائیو پیشرفت دیکھ سکتے ہیں۔