2月5日,快手旗下可灵AI上线3.0系列模型,覆盖视频、图片和多模态创作。新版本把人物一致性、镜头衔接和声音表现放在了更重要的位置,单次生成视频最长可达15秒,还支持多种语言和部分方言。

过去,不少人第一次用AI做视频时,都会遇到类似的问题:前一个镜头里还是同一张脸,到了下一个镜头,人物就像换了一个人;刚刚还拿在手里的东西,转眼就不见了;人物走路、转身时,动作也容易显得僵硬。

这次升级,主要就是想解决这些麻烦。用户可以上传人物照片、物品图片或参考视频,让系统尽量记住画面里的角色和场景。做一段连续故事时,人物的脸、衣服和整体风格不容易突然变化。

比如,一名小店老板想为自家咖啡店做一条宣传视频。他上传店面和咖啡师的照片,再写下:“清晨,咖啡师推开店门,打开灯,把刚磨好的咖啡递给第一位客人。”系统可以根据这段文字安排店外远景、制作咖啡的近景,再切到顾客接过杯子的画面。

以前,这样一条十几秒的视频,可能要先拍店面,再拍人物,还要找人剪辑。现在,即使没有拍摄经验,也能先做出一个基本完整的版本。对预算有限的小商家、自媒体创作者和刚接触视频制作的人来说,这种变化很直接。

智能分镜也让操作简单了一些。用户写下一段带有多个场景的描述,系统会尝试安排远景、近景和镜头切换。原本需要一段一段生成、再放进剪辑软件拼接的画面,现在有机会一次完成。

但真正用起来,仍然不是写一句话就能马上得到满意的视频。人物在做复杂动作时,手脚和表情偶尔还是会出问题;描述写得不够清楚,画面也可能和想象中不一样。想得到一条能用的成片,往往还要修改文字,重新生成几次。

可灵AI 3.0让视频制作的门槛又低了一些。不会拍摄、不会剪辑的人,也能把脑海里的画面做出来。只是,工具可以帮人完成镜头,不能替人想出故事。画面能不能打动人,最后看的还是创作者有没有真正想表达的东西。