有个AI直播实验挺有意思。

直播画面正在播放,评论区里有人随手打了一句:“下点雪。”没过多久,画面里的场景真的开始下雪。换一个人说想看别的地方,后面的内容也会跟着变。

这已经不太像我们熟悉的直播了。平时进直播间,观众能做的事无非是发弹幕、点歌、送礼物,最多投票决定主播接下来干什么。现在,弹幕里的那句话有机会直接变成画面,观众手里像是突然多了一点“导演权”。

这套玩法背后用到的是H3 Max。它基于MiniMax开源的视频模型H3继续做了优化,最值得注意的不是画面又清晰了多少,而是速度。fal Research公布的信息显示,H3 Max生成5秒视频可以压到3秒以内。

做过AI视频的人应该知道,这个速度意味着什么。一段几秒钟的画面,等几十秒生成很常见。剪视频时等一等没太大问题,直播间却等不起。观众刚说完想看什么,几分钟以后才出现,那股参与感早就过去了。

现在生成时间被压下来,事情就有了变化。前面的画面还在播,系统可以继续生成后面的内容,评论区里新冒出来的想法,也有机会被接进去。直播内容不一定从头到尾都提前准备好,而是在播放过程中慢慢长出来。

这也是这件事真正有意思的地方。AI视频过去更多是制作工具:写一句提示词,传张图片,生成一段素材,再从里面挑能用的。放到直播里,它开始变成一种互动方式。

想象一下,一个主播只负责搭好故事的开头,角色走到十字路口后,往左还是往右由评论区决定;有人喊去海边,有人想去火星,接下来的画面就顺着观众的选择继续生成。这样的直播,和看一段提前录好的视频已经是两回事了。

离真正稳定使用还有一段路。人物播久了会不会变脸,场景前后能不能接得住,几百个人一起发指令时到底听谁的,这些问题都摆在那里。

可直播的边界已经开始松动了。主播负责开场,观众不只是围观,故事往哪走,也许真的能由直播间里的人一起决定。