复杂动作
同一动作 prompt 重复 3 次并保留失败结果。
Gemini Omni Flash 将多模态参考与对话式生成、编辑结合。快手可灵 3.0 系列支持文本、图片、音频和视频输入,并提供多语言原生音频、参考生视频、视频内编辑与最长 15 秒的多镜头分镜。
Google 与快手官方资料核验于 2026-09-08

公开能力与主观输出质量分开比较。
Last updated
来源:Gemini Omni 官方指南与价格;快手 2026 年 2 月 5 日可灵 3.0 官方发布稿。快手发布稿没有给出 API 官方标价或视频分辨率表,因此对应行只描述公开程度,不猜测数值。
| Feature | Gemini Omni Flash | 可灵 3.0 |
|---|---|---|
| 官方入口 | Google AI Studio / Gemini API | 可灵 AI 产品;快手官方发布稿已说明访问 |
| 输入 / 参考模式 | 文本、图片、短视频参考;首尾帧 | 文本、图片、音频、视频;多图与参考视频 |
| 时长 | 3–10 秒;扩展后总长最高 40 秒 | 最长 15 秒 |
| 原生音频 | 生成带音频的视频 | 多语言、方言和口音;音效与音乐 |
| 编辑 / 分镜 | 对话式编辑与场景扩展 | 视频内编辑与多镜头分镜生成 |
| 分辨率披露 | 360p、720p、1080p 或 4K | 官方发布稿未提供视频分辨率表 |
| 官方价格披露 | 每输出秒 0.10 美元 | 官方发布稿未提供 API 标价 |
公开能力覆盖
基于官方披露的透明推断,不代表主观画质实测。
评分规则:10 = 官方明确且完整支持;5 = 部分支持或披露有限;0 = 引用的官方资料未披露。分辨率与价格分数衡量公开证据覆盖,不代表隐藏产品能力。
证据快照:官方资料核验于 2026-09-08
● 测试方案
图片仅解释测试场景,不是模型输出。
同一动作 prompt 重复 3 次并保留失败结果。
比较人物与构图相对输入首帧的偏移。
可灵 3.0 官方发布资料覆盖更广的原生输入、多镜头分镜和最长 15 秒视频;Gemini Omni Flash 明确公布 4K、官方标价、对话式编辑与总长最高 40 秒的扩展。雷达图比较公开能力覆盖,不评判画质。
● FAQ