AI生成语音/克隆方面现在哪些平台比较强啊?开源有什么平替推荐吗?

Xiubug 2026-08-11 18:05 1

最近刷短视频的时候看到很多AI生成的视频中人物的语音的还原度,甚至语气的变化,停顿都非常的好,有没有佬比较懂这方面的给讲讲现在声音领域哪些AI平台比较牛呢(我目前了解到的有字节系和minimax的好像还不错挺不错的,但是具体哪个更好更有性价比不是很了解)。

以及有没有什么好的开源方案推荐呢(我之前尝鲜本地部署跑过b站的那个IndexTTS-2和阿里的那个TTS3那种零样本克隆,前天又试了一下GPT-SoVITS,但是感觉效果不是很好可能是我训练的数据集太少了)。有没有比较懂的佬友说一下现在闭源和开源的差距大吗,有必要用开源的项目本地跑吗?开源的话哪个项目在克隆效果上会更好一些呢,因为我看这几个项目都比较聚焦零样本克隆,感觉还原度可能不会那么高只是勉强能用的样子,阿里的这个TTS3倒是支持本地微调训练。GPT-SoVITS的话我感觉可能是我训练集时长太短了出来的效果没那么好。

最新回复 (3)
  • 钟阮 08-11 18:12
    1

    闭源我觉得Minimax的挺好的


    开源的,emmm之前测过Qwen和智谱的,都不如Minimax的

  • Xiubug 楼主 08-11 18:35
    2

    主要我记得这些闭源平台好像克隆声音的时候只能上传很短一段音频来克隆,但是我总感觉数据集比较小的话效果就会差一点哈哈哈

  • jx23 08-11 21:23
    3

    qwen3-tts我在本地跑通了音色微调,包括全模型微调和lora微调。复制效果还不错,但是只能tts。也就是语气是没法做到很好的,后面就当玩具放着了。

* 帖子来源Linux.do
返回