Utworzone za pomocą tej aplikacji
Gemini Omni Flash 1.1 to multimodalny model wideo od Google'a, dostępny tutaj jako skoncentrowana aplikacja do generowania i edytowania wideo krótkiej formy. Akceptuje prompt tekstowy, obraz statyczny, opcjonalną klatkę końcową, do dziesięciu obrazów referencyjnych lub trzy klipy referencyjne, a także może edytować istniejące wideo na podstawie instrukcji w języku naturalnym. Wyjście działa od 360p do 4K w zakresie trzech do dziesięciu sekund z natywnym zsynchronizowanym dźwiękiem wbudowanym. Nadaje się dla twórców, marketerów i deweloperów, którzy potrzebują precyzyjnej ciągłości wizualnej, czytelnego tekstu na ekranie i wypolerowanego dźwięku bez osobnego przetwarzania audio.
Jak używać tej aplikacji
- 1
Opisz, co chcesz utworzyć, lub prześlij swój plik źródłowy.
- 2
Wybierz opcje, a następnie naciśnij Generuj.
- 3
Obserwuj, jak Twój wynik pojawia się w galerii w ciągu chwili.
- 4
Pobierz, udostępnij lub generuj ponownie z nowym pomysłem.
Co możesz tworzyć
Zbliżenie produktu z dźwiękiem
Opisz produkt, dostarcz zdjęcie statyczne jako klatkę początkową, a model ożywi je w 4K z zsynchronizowanym dźwiękiem otoczenia lub w stylu voice-over. Wiedza modelu o świecie utrzymuje etykiety i tekst na opakowaniu czytelnym w każdej klatce, eliminując powszechny problem w wideo produktów generowanych przez AI.
Ciągłość postaci sterowana referencją
Prześlij do dziesięciu obrazów referencyjnych postaci lub lokalizacji, aby kierować generowaniem. Gemini Omni Flash 1.1 utrzymuje tożsamość wizualną spójną w całym montażu, czyniąc to praktycznym dla sekwencji w stylu storyboardu, maskotów marki lub powtarzających się ustawień scen, które muszą wyglądać identycznie w każdym ujęciu.
Edycja istniejącego klipu na podstawie instrukcji
Wrzuć wideo źródłowe i wpisz instrukcję edycji w języku naturalnym, taką jak zmień niebo na pochmurne lub usuń bałagan w tle. Model zastosuje zmianę bez osobnego kroku kompozycji, przydatne do szybkich rund rewizji materiału, który jest w inny sposób gotowy.
Grafika ruchu z nakładką tekstową
Ponieważ model jest zakotwiczony w wiedzy świata Gemini, tekst na ekranie renderuje się poprawnie i pozostaje ostry podczas ruchu. Użyj tego do kinematycznych tytułów, dolnych trzecich lub calloutów danych, gdzie inne modele generatywne zazwyczaj produkują zniekształcony lub dryfujący tekst.
Sceny historii od obrazu do wideo
Dostarcz obraz początkowy i opcjonalną klatkę końcową, aby zdefiniować pierwsze i ostatnie momenty sceny, a następnie pozwól modelowi interpolować akcję pomiędzy nimi. Działa to dobrze w przypadku prezentacji koncepcji, animatyk i pitch decków, gdzie potrzebujesz kontrolowanego ruchu ze statycznej grafiki.
Pomysły promptów do wypróbowania
Dlaczego twórcy używają tej aplikacji
- Natywny zsynchronizowany dźwięk
- Wyjście od 360p do 4K
- Czas trwania: 3-10s
- Wejście tekstowe, obrazowe i referencyjne
- Sterowanie wideo referencyjnego
- Edytuj film na podstawie instrukcji
Wskazówki do lepszych wyników
Zakotwicz tekst w promptie
Gdy wideo wymaga czytelnych słów, wpisz je dokładnie w prompt. Gemini Omni Flash 1.1 jest zakotwiczony w wiedzy świata, co daje mu przewagę w dokładności kształtu liter, ale jawny prompt nadal zmniejsza dryfowanie i zapewnia, że model priorytetyzuje ten element.
Użyj klatki końcowej do kontroli
Dostarczenie zarówno obrazu początkowego, jak i klatki końcowej daje modelowi dwa punkty zakotwiczenia do interpolacji. To najbardziej niezawodny sposób kontrolowania łuku i kompozycji, gdy potrzebujesz konkretnego efektu wizualnego na koniec klipu zamiast otwartego ruchu.
Warstwuj wejścia referencyjne strategicznie
Model akceptuje do dziesięciu obrazów referencyjnych i trzy klipy referencyjne jednocześnie. Użyj slotów obrazów do spójności postaci lub obiektu, a slotów klipów do zdefiniowania stylu ruchu lub zachowania kamery. Mieszanie obu typów wejścia w jednym generowaniu daje ci dokładniejsze sterowanie niż każdy z nich osobno.
Pisz instrukcje edycji precyzyjnie
Korzystając z trybu edycji wideo, opisz, co zmienić i co zachować w tej samej instrukcji. Fraza taka jak zmień kolor ściany na głęboką turkusową, zachowaj meble i oświetlenie identyczne jest znacznie bardziej efektywna niż niejasna dyrektywa, ponieważ ustawia wyraźne ograniczenia zarówno na edycję, jak i na niezmienione elementy.
Kiedy wybrać tę aplikację
Wybierz tę aplikację, gdy priorytetem jest rozdzielczość 4K z natywnym zsynchronizowanym dźwiękiem z jednego przebiegu generowania, sterowana referencją ciągłość wizualna w wielu zasobach, czytelny tekst na ekranie lub możliwość edycji istniejącego klipu poprzez wpisaną instrukcję. Seedance 2.5 obejmuje dłuższe przebiegi do 30 sekund i akceptuje znacznie więcej materiału referencyjnego, co jest lepszym wyborem, gdy czas trwania lub głębia referencji ma większe znaczenie niż poziom rozdzielczości. Wan 3.0 oferuje 30-sekundowe wideo z jednego przebiegu z omni-referencją, czyniąc go silniejszym wyborem dla rozszerzonych scen. Gemini Omni Flash 1.1 to właściwy wybór, gdy potrzebujesz najwyższej rozdzielczości wyjścia z trzech opcji, lub chcesz zmienić istniejący klip, wpisując instrukcję zamiast regenerować go.
Często zadawane pytania
Czy mogę generować wideo bez dostarczania żadnego obrazu?
Tak. Aplikacja akceptuje sam prompt tekstowy. Obrazy, klatki końcowe, obrazy referencyjne i klipy referencyjne to wszystkie opcjonalne wejścia. Musisz je dostarczyć tylko wtedy, gdy chcesz sterować ciągłością wizualną, zdefiniować punkty końcowe ruchu lub dopasować konkretną postać lub lokalizację do materiału źródłowego.
Jak działa natywny zsynchronizowany dźwięk w wyjściu?
Gemini Omni Flash 1.1 generuje dźwięk jako część tego samego przebiegu modelu, który produkuje wideo, więc dźwięk jest zsynchronizowany z wizualizacją zamiast być dodanym jako ścieżka generyczna później. Wynikowy plik MP4 zawiera kanał audio już wbudowany, gotowy do użycia bez osobnego kroku miksowania.
Jaka jest maksymalna liczba wejść referencyjnych, które mogę dostarczyć?
Możesz dostarczyć do dziesięciu obrazów referencyjnych i do trzech klipów wideo referencyjnych w jednym generowaniu. Te wejścia kierują model w stronę spójnej tożsamości wizualnej dla postaci, obiektów, lokalizacji lub stylu ruchu kamery, w zależności od tego, co przedstawiają referencje.
Czy tryb edycji wideo działa na każdym przesłanym klipie?
Tryb edycji przyjmuje istniejące wideo jako źródło i stosuje instrukcję w języku naturalnym, aby je zmodyfikować. Model interpretuje język naturalny, więc nie musisz określać parametrów technicznych. Wyniki są najbardziej spójne, gdy instrukcja wyraźnie stwierdza zarówno, co powinno się zmienić, jak i co powinno pozostać takie samo.
Jaką rozdzielczość wybrać do dostarczania w mediach społecznościowych lub sieci?
W przypadku większości platform społecznościowych 1080p to praktyczne ustawienie domyślne, ponieważ równoważy jakość wizualną z rozmiarem pliku i wymaganiami przesyłania. Użyj 4K, gdy miejsce docelowe to obsługuje, na przykład demo wyświetlacza o wysokiej rozdzielczości lub platforma, która elegancko zmniejsza rozdzielczość ze źródła wyższego. 720p nadaje się do podglądów lub szkiców. 360p jest przydatny do szybkiej iteracji przed zatwierdzeniem ostatecznej rozdzielczości.
Jak utrzymać postać spójną w wielu oddzielnych generowaniach?
Zapisz obrazy referencyjne z jednego generowania i dostarcz je jako wejścia referencyjne w następnym. Model akceptuje do dziesięciu obrazów referencyjnych na przebieg, więc możesz uwzględnić wiele kątów lub wyrażeń tej samej postaci, aby wzmocnić spójność. Połączenie referencji obrazów z opisowym promptem, który wymienia charakterystyczne cechy postaci, dodatkowo poprawia koherencję.
Który model AI obsługuje tę aplikację?
Ta aplikacja działa na Gemini Omni Flash 1.1, dostępnym za pośrednictwem Arteza bez konieczności zakładania oddzielnego konta ani konfiguracji.
Czy mogę używać wyników komercyjnie?
Tak. Treść, którą generujesz, jest Twoja do użytku, zgodnie z naszymi licencjami treści.
Jak długo trwa generowanie?
Większość generacji kończy się w mniej niż minutę i możesz obserwować postęp na żywo w galerii.