Utworzone za pomocą tej aplikacji
Seed Audio 1.0 to aplikacja do generowania audio sterowana monitorem tekstowym, która zamiania pisane opisy w ekspresyjną mowę, dialog wielu postaci i warstwowe sceny dźwiękowe, wszystko w jednym przebiegu. Zbudowana na Seed Audio 1.0 firmy ByteDance, obsługuje język angielski i chiński, akceptuje obraz lub do trzech klipów audio referencyjnych, aby kierować charakterem głosu, i pozwala na ponowne użycie już sklonowanych głosów. Sprawdza się dla podkastrów, scenarzystów gier, animatorów, twórców języków i wszystkich, którzy potrzebują audio gotowego do produkcji bez studia nagraniowego.
Jak używać tej aplikacji
- 1
Opisz, co chcesz utworzyć, lub prześlij swój plik źródłowy.
- 2
Wybierz opcje, a następnie naciśnij Generuj.
- 3
Obserwuj, jak Twój wynik pojawia się w galerii w ciągu chwili.
- 4
Pobierz, udostępnij lub generuj ponownie z nowym pomysłem.
Co możesz tworzyć
Produkcja dialogu wielu postaci
Napisz scenę z dwiema lub więcej postaciami mówiącymi i pozwól Seed Audio 1.0 wyrenderować każdy głos z wyraźnym charakterem i emocjami. Przyporządkuj każdej roli klip referencyjny, aby utrzymać spójny ton w całych seriach, czyniąc to praktyczne dla serializowanych podcastów, audiobooków lub interaktywnej fikcji.
Naracja dwujęzyczna i lektor
Generuj narrację, która płynnie przełącza się między językiem angielskim a chińskim w ramach jednego monitoru. Jest to przydatne do dwujęzycznych modułów e-learningowych, demonstracji produktów skierowanych do odbiorców międzynarodowych lub treści w stylu dokumentalnym służącej użytkownikom obu języków bez potrzeby ponownego nagrywania.
Projektowanie otoczenia dźwiękowego
Opisz środowisko sonicznego, takie jak deszczowy bazar o zmierzchu lub napięty pokój serwerowy brzęczący od awarii sprzętu, i otrzymaj warstwową scenę o długości do dwóch minut. Twórcy gier i projektanci dźwięku filmowego mogą użyć tych materiałów jako podkładów referencyjnych lub śladów zastępczych na wczesnym etapie produkcji.
Casting głosu kierowany obrazem
Dostarcz ilustrację postaci lub portret i pozwól modelowi wnioskować o jakości głosu z wizualizacji. Ten skrót pomaga artystom koncepcyjnym i twórcom światów szybko dopasować głos do nieskastowanej postaci, zanim zostaną podjęte jakiekolwiek decyzje nagraniowe.
Ponowne użycie zasobu sklonowanego głosu
Jeśli już sklonowałeś głos w innym miejscu w Arteza, możesz się do niego odwoływać tutaj, aby utrzymać spójność narratorów brandowych, fikcyjnych protagonistów lub osobistych podpisów głosu w wielu projektach bez potrzeby przesyłania materiału źródłowego za każdym razem.
Pomysły promptów do wypróbowania
Dlaczego twórcy używają tej aplikacji
- Sceny sterowane promptem
- Sterowanie obrazem lub audio
- Angielski i chiński
- Ponowne wykorzystanie sklonowanych głosów
- Kontrola szybkości, głośności i wysokości
- Do 2 minut
Wskazówki do lepszych wyników
Zakotwicz głosy klipami referencyjnymi
Prześlij do trzech krótkich klipów audio referencyjnych dla postaci, aby kierować model w stronę określonej tekstury głosu, akcentu lub wieku. Im bardziej spójne są twoje klipy pod względem jakości nagrania i tonu, tym bardziej niezawodnie Seed Audio 1.0 będzie dopasowywać docelowy głos w każdym przebiegu.
Użyj kierowania obrazem dla nieskastowanych postaci
Jeśli masz sztukę postaci, ale nie masz głosu referencyjnego, dołącz obraz jako wejście kierujące. Model odczytuje wskazówki wizualne, takie jak pozorny wiek, postawa i wyraz, aby poinformować jakość głosu, oszczędzając kroku polegającego na znalezieniu lub nagraniu klasu referencyjnego od początku.
Bądź jawny co do środowiska sonicznego
W przypadku scen dźwiękowych opisz zarówno warstwy pierwszego planu, jak i tła w swoim monitorze. Wymienienie przestrzeni, odległości źródeł dźwięku i wszelkich tekstur otoczenia, które chcesz, takich jak pogłos w katedrze lub płaskość pokoju bezechowego, daje modelowi jaśniejsze parametry do pracy w limicie dwóch minut.
Zaplanuj długość w granicach limitu dwóch minut
Seed Audio 1.0 obsługuje do dwóch minut audio na przebieg. W przypadku dialogu szkicuj liczbę słów skryptu przed wysłaniem monitoru; mówiony angielski wynosi średnio około 130 słów na minutę, więc wymiana 200-słowna mieści się wygodnie, pozostawiając miejsce na pauzy i szczegóły otoczenia.
Kiedy wybrać tę aplikację
Wybierz tę aplikację, gdy Twój projekt łączy głos i środowisko w jednym przebiegu, wymaga dialogu wielu postaci z sterowalną tożsamością głosu lub potrzebuje dwujęzycznego wyjścia w angielskim i chińskim. Ponieważ na Arteza nie są wymienione żadne aplikacje siostrzane dla tej kategorii w tym momencie, najwyraźniejszy przypadek użycia Seed Audio 1.0 to jego połączenie konstruowania scen sterowanego monitorem tekstowym, kierowania obrazem lub audio oraz ponownego użycia sklonowanego głosu, zestaw narzędzi zaprojektowanych specjalnie dla twórców audio, którzy pracują w mowie, charakterze i otoczeniu w jednym przepływie pracy.
Często zadawane pytania
Czy mogę użyć angielskiego i chińskiego w tym samym przebiegu generowania audio?
Tak. Seed Audio 1.0 obsługuje angielski i chiński, i możesz napisać monitor dwujęzyczny, aby wytworzyć wyjście, które naturalnie przechodzi między oboma językami. Jest to szczególnie przydatne dla scen narracji lub dialogu zaprojektowanych do obsługi użytkowników obu języków w jednym pliku audio.
Ile klipów audio referencyjnych mogę przesłać, aby kierować głosem?
Możesz dostarczyć do trzech klipów audio referencyjnych na głos. Użycie wielu klipów, które mają spójną jakość nagrania i ton głosu, daje modelowi silniejszy sygnał, co generalnie daje dokładniejsze i bardziej powtarzalne wyniki niż poleganie na jednej krótkiej próbce.
Jaka jest maksymalna długość audio, którą mogę wygenerować w jednym przebiegu?
Każdy przebieg może wytworzyć do dwóch minut audio. Jeśli Twój skrypt lub koncepcja sceny jest dłuższa, zaplanuj podzielenie go na segmenty, które mieszczą się w tym limicie, i połącz je w przepływie edycji, używając sklonowanych lub referencyjnych głosów, aby utrzymać spójność w całych segmentach.
Czy mogę kierować głosem za pomocą ilustracji postaci zamiast nagrania?
Tak. Funkcja kierowania obrazem akceptuje portret lub ilustrację postaci i używa informacji wizualnych do poinformowania charakteru głosu. Jest to przydatne na wczesnym etapie produkcji, gdy istnieje artwork postaci, ale żaden aktor głosowy ani nagranie referencyjne nie został wybrany ani nagrany.
Jak utrzymuję ten sam głos spójnie w wielu projektach?
Gdy już sklonowałeś głos w Arteza, Seed Audio 1.0 pozwala ci odwoływać się do tego sklonowanego głosu bezpośrednio w nowych przebiegach. Oznacza to, że narrator marki, postać powtarzająca się lub twój własny podpis głosu mogą być ponownie użyte bez przesyłania świeżych materiałów referencyjnych za każdym razem, gdy zaczynasz nowy projekt.
Czy ta aplikacja jest odpowiednia do generowania audio niemowy, takie jak otoczenia otoczenia?
Tak. Seed Audio 1.0 jest przeznaczony do generowania scen dźwiękowych, nie tylko do mowy. Możesz wysłać monitor z czystą opisu otoczenia, określając lokalizacje, tekstury i warstwowe źródła dźwięku, aby wytworzyć podkłady otoczenia, tła atmosferyczne lub szkice audio przestrzenne bez jakichkolwiek dialogów lub narracji.
Ile to kosztuje?
Każde generowanie kosztuje 1 kredyt. Nowe konta otrzymują bezpłatne kredyty do wypróbowania.
Który model AI obsługuje tę aplikację?
Ta aplikacja działa na Seed Audio 1.0, dostępnym za pośrednictwem Arteza bez konieczności zakładania oddzielnego konta ani konfiguracji.
Czy mogę używać wyników komercyjnie?
Tak. Treść, którą generujesz, jest Twoja do użytku, zgodnie z naszymi licencjami treści.
Jak długo trwa generowanie?
Większość generacji kończy się w mniej niż minutę i możesz obserwować postęp na żywo w galerii.