多模态参考
在 API 支持范围内组合文字、图片和短视频输入。
● 视频生成器
输入提示词、上传图片,或结合两者,在几秒内生成电影感视频。
请先填写提示词。
将文字、图片、音频和视频变成电影感短片,由 Google 的 Gemini Omni Flash 模型驱动。
无需 Google 订阅,使用邮箱登录即可开始生成。
多模态输入 · 对话式编辑 · 真实物理效果

● 是什么
它是 Google 推出的多模态视频模型,可结合文本、图片和短视频参考,并通过自然语言继续编辑。Google 在 2026 年 6 月公布的预览价格为每秒输出视频 0.10 美元,当前单次生成上限为 10 秒。
在 API 支持范围内组合文字、图片和短视频输入。
用自然语言继续调整已生成视频。
预览公告中,API 暂不支持音频参考与场景延展;生产使用前应再次核对官方文档。
持续更新模型能力、对比内容与产品体验。
上线中文核心页面、模型对比指南与专属视觉示例。
Google 公布首尾帧控制、场景延展与 4K 放大等能力。
Gemini Omni Flash 进入 Google AI Studio 与 Gemini API。
● 模型怎么选
厂商公开信息与 Gomni 实测严格分开;没有可回溯样本的数据统一显示“尚未测试”。
查看访问方式、参考控制、首帧测试与成本字段。
比较 Google 与 OpenAI 的工作流,不制造永久赢家。
参数未核验或没有样本时明确留空。
● FAQ