注册以后进入 Voice Clone,页面会让你依次录完 25 个句子。
整个采集过程不长。
我录完并提交后,大约等了半小时,声音模型训练完成。
真正开始生成时,最明显的问题是语言支持。
一开始想直接测试中文,但网页端提示不支持。后来查资料才发现,MyVocal 早期确实主要围绕英语做,其他语言逐步放到付费版本和后续模型里。
现在 V3 API 虽然已经列出中文在内的 98 种语言,但网页产品能不能直接用到同样的模型,不能只看 API 文档判断。
英文测试相对顺利。
我放进去一段普通文本,生成声音的音色确实能听出和原声有些接近,整体也比较流畅。
但长句一多,AI 味就明显起来了。
停顿、重音和情绪变化没有真人那么自然,尤其是需要明显情感起伏的句子,更像是在把文字顺畅念完,而不是正常聊天。
所以声音“像不像”和“自然不自然”其实是两回事。
MyVocal 在前者上能做到一定程度,后者还会暴露不少合成痕迹。
隐私问题比生成速度更值得注意。
MyVocal 早期曾被媒体质疑运营信息不透明。现在已经能查到运营主体,但克隆声音意味着要把一组能识别个人音色的录音交给平台。
如果只是娱乐测试,风险判断可能比较简单。
涉及工作录音、客户资料或者长期商业使用时,就应该先确认录音保存方式、删除机制和授权范围,再决定要不要上传。
优缺点
优点
- 克隆流程短。 录完 25 句话就可以开始训练,不需要准备大量音频。
- AI Singer 有辨识度。 除了普通 TTS,还能让克隆声音唱歌。
- 免费版可以试完整流程。 适合先判断声音还原度。
- 提供 API。 开发者可以把语音生成能力接进自己的产品。
- 操作门槛不高。 不需要专业录音或语音模型知识。
缺点
- 中文网页端支持不够明确。 API 已经扩展语言范围,但网页端能力需要另外确认。
- 自然度有限。 长句、停顿和情绪表达仍容易听出合成感。
- 历史价格比较混乱。 不同时期和渠道的数据差异很大。
- 声音数据涉及隐私。 使用克隆功能前需要认真看数据和授权条款。
- 专业控制能力有限。 对语速、停顿和细节表达的控制不如专业语音平台。
适合谁 / 不适合谁
适合:
- 想体验声音克隆的人。 想知道 AI 模仿自己的声音能做到什么程度。
- 对 AI 唱歌感兴趣的人。 AI Singer 是比较直接的娱乐玩法。
- 需要快速做声音 Demo 的创作者。 可以先用克隆声音测试旁白和内容节奏。
- 需要语音 API 的开发者。 想快速接入声音克隆或 TTS 功能。
不太适合:
- 主要制作专业中文配音的人。 中文支持和实际效果需要先单独验证。
- 对声音数据安全要求很高的人。 上传个人声音前需要确认平台的数据处理方式。
- 需要广播级成品的人。 自然度和情绪控制还不能完全替代真人配音。
- 需要精细语音控制的团队。 如果每一句都要调整停顿、语速和语调,MyVocal 的控制深度可能不够。
评论(0)