Được tạo bằng ứng dụng này
OmniHuman v1.5 chuyển đổi một bức ảnh chân dung đơn lẻ và một tệp âm thanh thành video avatar nói chuyện được hoạt hình hoàn toàn, hoàn chỉnh với chuyển động môi đồng bộ, biểu cảm khuôn mặt tự nhiên và cử chỉ phù hợp với lời nói. Đầu ra là một tệp MP4 sạch sẽ ở độ phân giải 720p hoặc 1080p, giúp bạn có thể sử dụng cho người dẫn dắn ảo, phát ngôn viên thương hiệu, giảng viên học trực tuyến và bất kỳ ai cần video talking-head chuyên nghiệp mà không cần thiết bị quay phim hay phòng thu.
Cách sử dụng ứng dụng này
- 1
Mô tả những gì bạn muốn tạo hoặc tải lên tệp nguồn của bạn.
- 2
Chọn các tùy chọn của bạn, sau đó nhấn Tạo.
- 3
Xem kết quả của bạn xuất hiện trong thư viện trong vài khoảnh khắc.
- 4
Tải xuống, chia sẻ hoặc tạo lại với một ý tưởng mới.
Những gì bạn có thể tạo
Giảng viên Khóa học Ảo
Tải lên ảnh đầu chuyên nghiệp và kịch bản bài giảng được ghi âm để tạo ra một giảng viên trên màn hình nói chuyện, có cử chỉ và phản ứng tự nhiên. OmniHuman v1.5 giữ các biểu cảm khuôn mặt phù hợp với nội dung âm thanh, do đó avatar cảm thấy sôi nổi hơn là máy móc trên toàn bộ cửa sổ âm thanh 60 giây ở độ phân giải 720p.
Bản Demo Sản phẩm Đa ngôn ngữ
Ghi âm lời tường thuật bằng bất kỳ ngôn ngữ nào, kết hợp với một bức ảnh đại diện thương hiệu, và tạo video phát ngôn viên bản địa hóa trong vài phút. Vì OmniHuman v1.5 rút ra cử chỉ từ nhịp điệu lời nói, ngôn ngữ hình thể sẽ thích ứng với nhịp độ tự nhiên của từng ngôn ngữ mà không cần bất kỳ khung hình chủ chốt thủ công nào.
Thông báo Nội bộ Công ty
Các đội HR và truyền thông có thể chuyển đổi một bức ảnh đầu của giám đốc điều hành thành một video thông báo chuyên nghiệp để phân phối toàn công ty. Tùy chọn đầu ra 1080p đảm bảo video giữ chất lượng trên màn hình lớn, trong khi sự đồng bộ môi hoàn hảo duy trì tính tin cậy khi giám đốc điều hành không thể xuất hiện trực tiếp trước máy ảnh.
Video Nhân vật Phương tiện Xã hội
Những người sáng tạo nội dung muốn ở phía sau bậu cửa có thể xây dựng một nhân vật trên màn hình nhất quán từ một chân dung. Nhập âm thanh kịch bản cho mỗi bài đăng và nhận một video MP4 avatar duy trì khuôn mặt, biểu cảm và phong cách cử chỉ giống nhau trên tất cả video trong một chuỗi.
Quảng cáo Tiếp thị Nguyên mẫu
Trước khi cam kết với một buổi quay trực tiếp, các đội tiếp thị có thể xác thực kịch bản và hướng hình ảnh bằng cách tạo video người dẫn dắn thực tế từ ảnh stock hoặc ảnh khái niệm. Giới hạn 30 giây ở 1080p phù hợp tốt với các định dạng quảng cáo và video phương tiện xã hội điển hình, giúp các chu kỳ xem xét diễn ra nhanh hơn và rẻ hơn.
Ý tưởng prompt để thử
Tại sao các nhà sáng tạo sử dụng ứng dụng này
- Đầu vào Ảnh duy nhất
- Đồng bộ hóa Môi hoàn hảo
- Biểu cảm Tự nhiên
- Tạo ra Cử chỉ
- Chế độ Turbo
- Đầu ra 720p/1080p
Mẹo để có kết quả tốt hơn
Chọn một Chân dung Sạch sẽ
OmniHuman v1.5 xây dựng toàn bộ hoạt hình từ một bức ảnh duy nhất, vì vậy chất lượng hình ảnh rất quan trọng. Sử dụng một chân dung được chiếu sáng tốt, hướng về phía trước với nền trung tính. Tránh các bộ lọc nặng, góc độ cực đoan hoặc cắt xén khuôn mặt một phần, vì những điều này hạn chế mức độ chính xác mà mô hình có thể tạo chuyển động môi và biểu cảm.
Khớp Độ dài Âm thanh với Độ phân giải
Ứng dụng hỗ trợ tối đa 60 giây ở 720p và 30 giây ở 1080p. Lên kế hoạch kịch bản của bạn để vừa với giới hạn chính xác trước khi ghi âm. Cắt âm thanh sau đó thường tạo ra các kết thúc đột ngột, vì vậy hãy viết và sắp xếp thời gian lời tường thuật của bạn trước, sau đó chọn độ phân giải phù hợp với khoảng thời gian âm thanh của bạn.
Sử dụng Âm thanh Biểu cảm để Có Cử chỉ Tốt hơn
Tạo cử chỉ trong OmniHuman v1.5 được điều khiển bởi nhịp điệu lời nói và cảm xúc trong âm thanh. Bản ghi âm, đơn điệu sẽ tạo ra chuyển động tối thiểu. Ghi âm với tốc độ tự nhiên, nhấn mạnh đa dạng và ý định cảm xúc rõ ràng để có được avatar năng động hơn, giống như thật hơn với độ nghiêng đầu thích hợp và cử chỉ cơ thể.
Sử dụng Chế độ Turbo để Lặp lại Nhanh
Chế độ Turbo tăng tốc độ tạo, làm cho nó lý tưởng để kiểm tra các lần ghi âm hoặc lựa chọn chân dung khác nhau trước khi cam kết với kết xuất cuối cùng. Soạn avatar của bạn ở 720p với Chế độ Turbo trước tiên, xác nhận kết quả đáp ứng nhu cầu của bạn, sau đó tạo phiên bản 1080p đã hoàn thiện để phân phối.
Khi nào nên chọn ứng dụng này
OmniHuman v1.5 là lựa chọn đúng khi tính chân thực và sự đồng bộ biểu cảm là những ưu tiên hàng đầu. So với SadTalker, nó tạo ra chuyển động khuôn mặt tự nhiên hơn đáng chú ý và hoạt hình cử chỉ đầy đủ thay vì chỉ chuyển động đầu. So với Sync-3 Lipsync, nó tạo ra một avatar được hoạt hình hoàn chỉnh từ một bức ảnh duy nhất thay vì yêu cầu video hiện có làm đầu vào. Nếu mục tiêu của bạn là một người dẫn dắn ảo đáng tin cậy từ tài liệu nguồn tối thiểu, OmniHuman v1.5 là giải pháp hoàn chỉnh nhất trong danh sách.
Các câu hỏi thường gặp
Tôi có thể sử dụng chân dung minh họa hoặc được định kiểu thay vì ảnh chụp không?
OmniHuman v1.5 có thể hoạt hình các chân dung không phải ảnh chụp như minh họa kỹ thuật số hoặc nhân vật được kết xuất, nhưng kết quả đáng tin cậy nhất với các chân dung con người thực tế. Các hình ảnh được định kiểu cao với tỷ lệ cơ thể phóng đại hoặc các tính năng không phải con người có thể tạo ra sự đồng bộ môi và độ chính xác biểu cảm không nhất quán.
Mô hình có giữ lại nhận dạng và ngoại hình của người trong ảnh không?
Có. OmniHuman v1.5 giữ khuôn mặt, tông màu da, tóc và ngoại hình tổng thể nhất quán với chân dung đầu vào trong suốt video được tạo. Nó hoạt hình khuôn mặt hiện có thay vì thay thế nó, vì vậy avatar trông giống như người trong ảnh gốc.
Những định dạng âm thanh và mức chất lượng nào hoạt động tốt nhất?
Mặc dù ứng dụng chấp nhận các tệp âm thanh tiêu chuẩn, lời nói rõ ràng được ghi âm ở mức âm lượng nhất quán mà không có tiếng ồn nền hoặc nén nặng sẽ tạo ra sự đồng bộ môi chính xác nhất. Tránh âm thanh được xử lý nặng với tiếng vang hoặc giọng nói chồng chéo, vì những điều này có thể làm nhầm lẫn phát hiện nhịp điệu điều khiển tạo cử chỉ.
Có cách nào để kiểm soát cường độ của cử chỉ hoặc biểu cảm không?
Cường độ cử chỉ và biểu cảm trong OmniHuman v1.5 được suy ra tự động từ cảm xúc và nhịp điệu của âm thanh thay vì các điều khiển thủ công. Điều chỉnh cách phát biểu, tốc độ và tính biểu cảm của âm thanh được ghi âm là cách chính để ảnh hưởng đến mức độ hoạt hình của avatar trong video cuối cùng.
Avatar có thể nói bất kỳ ngôn ngữ nào không?
OmniHuman v1.5 tạo sự đồng bộ môi và cử chỉ từ dạng sóng âm thanh và nội dung cảm xúc của nó thay vì từ các quy tắc ngôn ngữ cụ thể, vì vậy nó hoạt động trên các ngôn ngữ. Độ chính xác môi có thể thay đổi nhẹ đối với các ngôn ngữ có các mẫu âm vị ít phổ biến hơn trong dữ liệu đào tạo, nhưng kết quả tổng thể rộng rãi đa ngôn ngữ.
Tôi nên làm gì nếu sự đồng bộ môi trông hơi lệch ở một số nơi?
Ghi âm lại với cách phát âm sạch sẽ hơn và tốc độ chậm hơn một chút thường giải quyết các vấn đề đồng bộ nhỏ. Bạn cũng có thể thử Chế độ Turbo để nhanh chóng kiểm tra một lần ghi âm thay thế trước khi dành tín dụng cho kết xuất 1080p đầy đủ. Tiếng ồn nền trong âm thanh gốc là nguyên nhân phổ biến nhất của độ lệch đồng bộ.
Mô hình AI nào hỗ trợ ứng dụng này?
Ứng dụng này chạy trên OmniHuman v1.5, có sẵn thông qua Arteza mà không cần tài khoản riêng hoặc thiết lập.
Tôi có thể sử dụng kết quả này cho mục đích thương mại không?
Có. Nội dung bạn tạo là của bạn để sử dụng, tuân theo giấy phép nội dung của chúng tôi.
Quá trình tạo mất bao lâu?
Hầu hết các quá trình tạo hoàn thành trong vòng một phút, và bạn có thể xem tiến độ trực tiếp trong thư viện.