一条十几秒的短视频,真正做起来并不轻松。
先写脚本,再找画面、配音乐、做字幕,最后还要反复剪辑。对个人创作者和小商家来说,一条短片往往要折腾大半天。
7月31日,MiniMax发布通用多模态生成模型H3。按照官方公布的信息,用户可以输入文字,也可以上传图片、视频或音频作为参考,生成最长15秒、最高2K分辨率的视频。画面完成时,双声道声音也能一起生成,不必再单独配音和加音效。
比如,一家服装店想做新品短片,可以上传商品图,再提供一段人物走路的视频,让画面中的模特按照参考动作展示衣服。做美食内容的人,也可以给出一张菜品照片和一段音乐,让镜头跟着节奏推进。
H3还支持设置视频的开头和结尾。用户可以分别上传首帧和尾帧,让模型在两张画面之间补出完整过程。官方资料显示,视频时长可在4秒至15秒之间选择。
这类工具最吸引人的地方,是把原本分散的工作放到了一起。过去,画面、动作、配音和音乐往往需要分别处理,现在可以在一次生成中完成。对没有专业拍摄团队的人来说,先做出一版样片会容易不少。
不过,生成完成并不意味着可以直接发布。人物动作是否自然、画面里的文字有没有写错、商品细节是否准确,仍然需要人工检查。复杂字体、小字和高难度场景,也可能出现不稳定的情况。
H3还不能替代摄影师和剪辑师,但它让更多人有机会先把脑海里的画面做出来。以前一个想法可能停在纸上,如今,写下几句话,就有机会看到它变成一段能播放的视频。
