このアプリで作成
Gemini Omni Flash 1.1はGoogleのマルチモーダルビデオモデルで、短編動画の生成と編集に特化したアプリとして利用できます。テキストプロンプト、静止画、オプションの終了フレーム、最大10枚の参照画像、または3つの参照クリップを受け入れ、既存のビデオを自然言語の指示で編集できます。出力は360pから4Kで3~10秒の長さとなり、ネイティブの同期オーディオが組み込まれています。クリエイター、マーケター、開発者が正確なビジュアル連続性、画面上の読みやすいテキスト、別途のサウンド処理なしで洗練されたオーディオが必要な場合に適しています。
このアプリの使い方
- 1
作成したいものを説明するか、ソースファイルをアップロードしてください。
- 2
オプションを選択して、「生成」を押してください。
- 3
数秒でギャラリーに結果が表示されます。
- 4
ダウンロード、シェア、または新しいアイデアで再度生成できます。
作成できるもの
製品クローズアップとオーディオ
製品を説明し、開始フレームとして静止写真を提供すると、モデルが4Kでそれを同期した環境音またはナレーション風のオーディオでアニメーション化します。モデルの世界知識により、パッケージのラベルとテキストがすべてのフレームで読みやすく保たれ、AI製品動画の一般的な課題が解決されます。
参照駆動型キャラクター連続性
キャラクターまたはロケーションの参照画像を最大10枚アップロードして、生成をコントロールします。Gemini Omni Flash 1.1はビジュアルアイデンティティをカット間で一貫して保つため、ストーリーボード風のシーケンス、ブランドマスコット、またはショットごとに同じに見える必要がある繰り返しシーン設定に実用的です。
既存クリップを指示で編集
ソースビデオをドロップして、「空を曇らせる」または「背景の乱雑さを削除する」などの自然言語の編集指示を入力します。モデルは別途のコンポジティング手順なしに変更を適用し、それ以外は完成したフッテージの迅速な修正ラウンドに役立ちます。
テキストオーバーレイモーショングラフィックス
モデルはGeminiの世界知識に基づいているため、画面上のテキストが正しくレンダリングされ、モーション全体でシャープに保たれます。これを運動的なタイトル、ロワーサード、またはデータコールアウトに使用します。他の生成モデルは通常、文字が乱れたり漂ったりします。
画像からビデオへのストーリービート
開始画像とオプションの終了フレームを提供してシーンの最初と最後の瞬間を定義し、モデルにその間のアクションを補間させます。これはコンセプトプレゼンテーション、アニマティクス、ピッチデックに適しており、静止アートワークから制御されたモーションが必要な場合に機能します。
試すプロンプトのアイデア
クリエイターがこのアプリを使う理由
- ネイティブ同期オーディオ
- 360pから4K出力
- 3~10秒の長さ
- テキスト、画像、参照入力
- 参照ビデオステアリング
- 指示からビデオを編集
より良い結果のためのヒント
プロンプトでテキストを固定
ビデオに読みやすい単語が必要な場合は、プロンプトに正確に綴ります。Gemini Omni Flash 1.1は世界知識に基づいているため、文字形の精度に優れていますが、明示的なプロンプトでもドリフトを減らし、モデルがその要素を優先することを保証します。
終了フレームを制御に使用
開始画像と終了フレームの両方を提供すると、モデルに補間する2つのアンカーが与えられます。これはクリップの結論で特定のビジュアルペイオフが必要な場合、開放的なモーションではなく、アークと構成を制御する最も信頼できる方法です。
参照入力を戦略的に層状化
モデルは最大10枚の参照画像と3つの参照クリップを同時に受け入れます。キャラクターまたはオブジェクトの一貫性のためにイメージスロットを使用し、モーションスタイルまたはカメラ動作を定義するためにクリップスロットを使用します。1つの生成で両方の入力タイプを混合すると、どちらか一方だけよりも細かいステアリングが得られます。
編集指示を正確に記述
ビデオ編集モードを使用する場合は、変更する内容と保持する内容を同じ指示で説明します。「壁の色を濃いティール色に変更し、家具と照明は同じままにする」というフレーズは曖昧な指示よりもはるかに効果的です。編集と変更されない要素の両方に明示的な制約を設定するためです。
このアプリを選ぶべき場面
このアプリを選択するのは、優先事項が4K解像度とネイティブの同期オーディオを1回の生成パスから得ること、複数のアセット間で参照制御されたビジュアル連続性、画面上の読みやすいテキスト、または入力された指示を通じて既存のクリップを編集する機能である場合です。Seedance 2.5は最大30秒の長い実行をカバーし、はるかに多くの参照素材を受け入れます。これは期間または参照の深さが解像度レベルよりも重要な場合に適しています。Wan 3.0は30秒の単一パスビデオとオムニリファレンスを提供し、拡張シーンに適した選択肢です。Gemini Omni Flash 1.1は、3つの中で最高の出力解像度が必要な場合、または既存のクリップを再生成するのではなく入力された指示で修正したい場合に適切な選択肢です。
よくある質問
画像をまったく提供せずにビデオを生成できますか?
はい。アプリはテキストプロンプトのみを受け入れます。画像、終了フレーム、参照画像、参照クリップはすべてオプションの入力です。ビジュアル連続性をステアリングしたい場合、モーションエンドポイントを定義したい場合、または特定のキャラクターまたはロケーションをソース素材に一致させたい場合にのみ提供する必要があります。
出力でネイティブの同期オーディオはどのように機能しますか?
Gemini Omni Flash 1.1はビデオを生成する同じモデルパスの一部としてオーディオを生成するため、サウンドは後で汎用トラックとして追加されるのではなく、ビジュアルに時間が合わせられます。結果のMP4にはオーディオチャネルが既に組み込まれており、別途のミックス手順なしで使用できます。
1回の生成で提供できる参照入力の最大数はいくつですか?
1回の生成で最大10枚の参照画像と最大3つの参照ビデオクリップを提供できます。これらの入力は、参照が描写する内容に応じて、キャラクター、オブジェクト、ロケーション、またはカメラモーションスタイルの視覚的アイデンティティの一貫性に向けてモデルをステアリングします。
ビデオ編集モードはアップロードされたクリップで機能しますか?
編集モードは既存のビデオをソースとして取得し、自然言語の指示を適用してそれを変更します。モデルは自然言語を解釈するため、技術パラメータを指定する必要はありません。指示が変更する内容と変更したままにする内容の両方を明確に述べている場合、結果は最も一貫しています。
ソーシャルまたはウェブ配信にはどの解像度を選択すべきですか?
ほとんどのソーシャルプラットフォームでは、1080pはビジュアル品質とファイルサイズおよびアップロード要件のバランスを取るため、実用的なデフォルトです。高解像度ディスプレイデモやより高いソースから適切にダウンサンプリングするプラットフォームなど、宛先がそれをサポートしている場合は4Kを使用します。720pはプレビューまたはドラフトに適しています。360pは最終解像度にコミットする前の迅速な反復に役立ちます。
複数の個別の生成間でキャラクターを一貫性を保つにはどうすればよいですか?
1つの生成から参照画像を保存し、次の生成で参照入力として提供します。モデルは実行ごとに最大10枚の参照画像を受け入れるため、同じキャラクターの複数の角度または表現を含めて一貫性を強化できます。画像参照をキャラクターの特徴的な特徴に名前を付ける説明的なプロンプトと組み合わせると、一貫性がさらに向上します。
このアプリはどのAIモデルで動作していますか?
このアプリはGemini Omni Flash 1.1で動作し、Artezaを通じて利用でき、別のアカウントやセットアップは不要です。
生成した結果を商用利用できますか?
はい。生成したコンテンツはご自身でご利用いただけます。当社のコンテンツライセンスに従ってください。
生成にはどのくらい時間がかかりますか?
ほとんどの生成は1分以内に完了し、ギャラリーでリアルタイムで進捗を確認できます。