小米开源了一个目标说话人语音识别模型,刚看到的时候其实觉得这个方向挺实用的。

不是因为它听起来多复杂,而是它解决的问题真的很常见。

平时我们说话的时候,默认环境都是比较干净的,但现实根本不是这样。开会的时候几个人一起讲话,吃饭聊天时旁边也有人说话,拍视频的时候还有各种背景声音。人可以很自然地分辨“我要听谁”,但AI不一定。

很多语音识别的问题,不是听不见,而是声音混在一起之后不知道该关注哪一个。

这个模型做的事情,就是帮AI先找到目标人物的声音。比如一场多人会议,你只想整理某个人说了什么,它可以尽量把这个人的声音提取出来,再进行识别。

这个场景其实挺多的。

会议记录不用把所有人的话混成一堆,采访整理会方便一些,视频字幕、直播内容处理也可能用得上。以后如果放到手机、耳机这些设备里,体验应该也会更自然。

我觉得小米这次开源比较有价值的一点,是它给了更多开发者去尝试的机会。

很多技术发布的时候看起来很厉害,但普通用户最后能不能感受到,还是要看有没有人把它做成真正有用的功能。开源之后,说不定会出现一些现在想不到的应用。

不过语音这件事本身就挺难。

多人同时讲话、不同人的声音特点、距离远近、环境噪音,这些都会影响效果。而且声音数据本身涉及隐私,怎么使用也需要注意。

但从方向上看,AI确实正在从“听到声音”往“知道该听谁”发展。

以前我们希望AI能听懂一句话,现在更希望它能在一堆声音里面找到真正重要的那个声音。

如果以后手机或者智能设备真的能做到这一点,很多交互可能会变得更像人在交流。