我主要关注了它的多轮编辑和角色一致性。
上手难度:很低。
在 Gemini 或 Flow 里输入提示词就能生成。真正影响效果的,不是参数,而是你会不会把镜头、动作和氛围说清楚。
只写“一个人在街上走”当然可以,但如果写成“镜头从中景缓慢推近,人物穿红色外套,雨后街道反射霓虹灯”,结果会更稳定。
最明显的提升,是不用一直重新抽卡。
以前 AI 视频常见的问题是,一处不满意就得重新生成整段。Gemini Omni 更像是在已有结果上继续修改。
比如角色没问题,只想换背景、调整镜头或者改变光线,可以直接继续说,不必从头开始。
角色一致性也比过去稳定。在多镜头场景里,人物的脸、服装和位置不容易突然变化,这对短片和广告很重要。
但复杂场景仍然会出错。
简单的重力、布料和物体运动通常比较自然,一旦涉及多个物体同时碰撞、复杂因果关系,画面就可能失真。
文字依旧是明显短板。参考图里如果带有复杂文字,生成后容易模糊、变形或直接写错。
另外,单次最长约 10 秒,真正做完整短片还是要拼接。
优点
- 对话式编辑很实用。 可以持续修改同一段视频,减少反复重做。
- 输入方式灵活。 文字、图片、音频、视频可以一起使用。
- 角色和场景更稳定。 多镜头叙事比以前更容易维持连续性。
- 视频与音频一起生成。 少了一步后期配音和环境音处理。
- Google 生态整合方便。 和 Gemini、Flow、YouTube 的衔接比较自然。
缺点
- 单次时长仍短。 10 秒左右的上限对长内容限制明显。
- 复杂物理场景会翻车。 多物体交互、碰撞和因果关系还不稳定。
- 文字生成不可靠。 特别是复杂英文和中文内容。
- 细节控制有限。 对话修改适合整体方向调整,还不能替代专业剪辑软件的逐帧控制。
- 需要付费。 想完整体验主要能力,至少要进入付费套餐。
适合:
内容创作者和视频博主
快速做 B-roll、创意素材和短视频片段。
广告和营销团队
很适合做概念片、提案和视觉方向测试。
教育和科普创作者
可以快速把抽象概念做成动态演示。
影视和动画前期团队
用来测试分镜、镜头运动和场景效果很方便。
不太适合:
需要电影级最终成片的人
目前还不能完全替代实拍、CG 和专业后期。
要求逐帧控制的用户
对话式编辑更适合宏观修改。
高度依赖画面文字的人
文字渲染仍然不够稳定。
需要连续长视频的人
目前仍然需要多段生成再拼接。
评论(0)