用此应用创建
Gemini Omni Flash 1.1 是谷歌的多模态视频模型,在此作为专门应用用于生成和编辑短视频。它接受文本提示、静止图像、可选的结束帧、最多十张参考图像或三个参考片段,并可根据纯文本指令编辑现有视频。输出从 360p 到 4K,时长为三到十秒,内置原生同步音频。适合需要精确视觉连贯性、屏幕文字清晰易读和精良音频的创意工作者、营销人员和开发者,无需单独的音频处理步骤。
如何使用此应用
- 1
描述您想创建的内容,或上传您的源文件。
- 2
选择您的选项,然后按生成。
- 3
观看您的结果在片刻内显示在图库中。
- 4
下载、分享或用新想法再次生成。
你可以创作的内容
产品特写与音频
描述一个产品,提供一张静止照片作为起始帧,让模型以 4K 的分辨率为其添加动画,并配上同步的环境音或旁白风格的音频。该模型的世界知识使标签和包装上的文字在每一帧都保持清晰易读,解决了人工智能产品视频中的常见痛点。
参考驱动的角色连贯性
上传最多十张角色或场景的参考图像来引导生成。Gemini Omni Flash 1.1 能在不同镜头间保持视觉身份的一致性,使其适用于故事板式序列、品牌吉祥物或必须保持相同外观的重复场景。
通过指令编辑现有片段
导入源视频并输入纯文本编辑指令,例如让天空变得阴沉或移除背景杂乱。模型无需单独的合成步骤即可应用更改,适合对基本完成的素材进行快速修订。
文字叠加动态图形
由于该模型基于 Gemini 的世界知识,屏幕文字能正确呈现并在运动中保持清晰。用于动态标题、下三分之一字幕或数据标注,而其他生成模型通常会产生模糊或漂移的字形。
图像转视频故事节拍
提供起始图像和可选的结束帧来定义场景的第一帧和最后一帧,然后让模型插值中间的动作。适合概念演示、分镜脚本和宣传资料,需要从静态图稿生成受控运动。
提示词灵感
创意工作者为什么使用此应用
- 原生同步音频
- 360p到4K输出
- 3-10秒时长
- 文本、图像和参考输入
- 参考视频指导
- 按指令编辑视频
获得更佳效果的技巧
用提示锚定文字
当视频需要清晰易读的文字时,在提示中准确拼写出来。Gemini Omni Flash 1.1 基于世界知识,在字形准确性上具有优势,但明确的提示仍能减少偏差并确保模型优先考虑该元素。
使用结束帧进行控制
同时提供起始图像和结束帧为模型提供两个插值锚点。当需要在片段结尾实现特定视觉效果而非开放式运动时,这是控制弧线和构图的最可靠方法。
战略性地分层参考输入
该模型同时接受最多十张参考图像和三个参考片段。使用图像槽位确保角色或物体的一致性,使用片段槽位定义运动风格或摄像机行为。在一次生成中混合使用两种输入类型比单独使用任一种都能提供更精细的控制。
精确编写编辑指令
使用视频编辑模式时,在同一指令中描述要更改的内容和要保留的内容。短语如将墙壁颜色改为深青色,保持家具和光线完全相同远比模糊指令更有效,因为它为编辑和未触及的元素都设置了明确的约束。
何时选择这个应用
当优先考虑 4K 分辨率与单次生成通道中的原生同步音频、跨多个资产的参考控制视觉连贯性、屏幕文字清晰易读或通过输入指令编辑现有片段的能力时,选择此应用。Seedance 2.5 支持长达 30 秒的更长时长并接受更多参考素材,当时长或参考深度比分辨率等级更重要时是更好的选择。Wan 3.0 提供 30 秒单通道视频与全方位参考,使其成为扩展场景的更强选择。当需要三款模型中最高的输出分辨率,或希望通过输入指令修改现有片段而非重新生成时,Gemini Omni Flash 1.1 是正确选择。
常见问题
我可以在不提供任何图像的情况下生成视频吗?
可以。该应用仅接受文本提示。图像、结束帧、参考图像和参考片段都是可选输入。仅当想要引导视觉连贯性、定义运动端点或将特定角色或位置与源素材匹配时才需要提供它们。
输出中的原生同步音频如何工作?
Gemini Omni Flash 1.1 在生成视频的同一模型通道中生成音频,因此声音与视觉同步,而不是事后添加为通用音轨。生成的 MP4 已嵌入音频通道,无需单独混音步骤即可使用。
我可以提供的参考输入的最大数量是多少?
在单次生成中,您可以提供最多十张参考图像和最多三个参考视频片段。这些输入根据参考内容描绘的内容,引导模型实现角色、物体、位置或摄像机运动风格的视觉身份一致性。
视频编辑模式是否适用于任何上传的片段?
编辑模式以现有视频为源,应用纯文本指令对其进行修改。模型解释自然语言,因此无需指定技术参数。当指令清楚地说明应更改的内容和应保留的内容时,结果最为一致。
我应该为社交媒体或网络传输选择什么分辨率?
对于大多数社交平台,1080p 是实用的默认选择,因为它平衡了视觉质量与文件大小和上传要求。当目标支持时使用 4K,例如高分辨率显示演示或能从更高源优雅降采样的平台。720p 适合预览或草稿。360p 在提交最终分辨率前用于快速迭代。
我如何在多个独立生成中保持角色的一致性?
保存一次生成中的参考图像,并在下一次生成中将其作为参考输入提供。该模型每次运行接受最多十张参考图像,因此可以包含同一角色的多个角度或表情以强化一致性。将图像参考与描述角色显著特征的提示相结合可进一步提高连贯性。
哪个 AI 模型驱动此应用?
此应用运行 Gemini Omni Flash 1.1,通过 Arteza 提供,无需单独账户或设置。
我可以商业使用结果吗?
可以。您生成的内容属于您,可以根据我们的内容许可证使用。
生成需要多长时间?
大多数生成在一分钟内完成,您可以在库中实时观看进度。