保持语调和情感, 只将音色换成要clone的声音的 tts, 怎么能实现呢?

twomonkeys 2026-08-13 17:02 1

我希望输入一段已经完成的语音,在尽可能保留原始内容、发音、语速、重音、停顿、气口、语调和情感的前提下,只改变说话人的音色和声纹。


有点像 elevenlab的一个演示 (https://www.youtube.com/watch?v=xU72OLqGdRo) 保持音调之类的, 音色换成另一个人的.


尝试了几个方法, 都不太行

- Applio/RVC:训练和推理流程已跑通,但音色变化不明显;继续增加训练轮数也没有实质改善。


- Vevo2 FM-only:短句有少量变化,长句稳定性不足。


- OpenVoice V2:能保留部分源音频时序,但目标音色相似度不足。


- IndexTTS 2.5:可以参考目标音色和风格重新生成,但不能严格保留源音频的原始韵律。


- Qwen3-TTS、VoxCPM2:能够根据参考音频生成目标音色,但不能稳定保留源音频原有的语调、停顿和节奏。


有佬有经验吗? 这种功能用啥方法能实现啊?

最新回复 (16)
  • 泽川 08-13 17:09
    1

    试试豆包语音呢,你看看火山里面 豆包人声做的挺不错的

  • Crain 08-13 17:14
    2

    mimotts 免费,可以试试,效果ok

  • WhaleInColdSky 08-13 17:14
    3

    可以试试隔壁的soniox?他们家的文字转语音还行

  • twomonkeys 楼主 08-13 17:15
    4

    mimotts试过, 还不如开源的呢… 不知道咋回事…

  • lueluelue 08-13 17:16
    5

    新出的,voice-changer


    Best AI Text To Speech & Free Voice Cloning | Fish Audio

  • gebide 08-13 17:17
    6

    cosyvoice呢? 有些英文可能朗读不是很好,中文没啥问题

  • twomonkeys 楼主 08-13 17:20
    7

    多谢老, 这就去试试, 看起来很靠谱的样子 ^-^

  • murso 08-13 17:21
    8

    SSML语音标记文本,像cosyvoice这类也有自己的控制语法

  • lueluelue 08-13 17:33
    9

    这家我只知道Voice Clone一句话就能clone


    还有识别多个人同时说话

  • muyouzhi 08-13 19:57
    10

    你这个需求不是tts,而是变声器,可以看看RVC这个项目,花儿不哭的,支持实时变声和音频推理(你的需求),GitHub - RVC-Project/Retrieval-based-Voice-Conversion-WebUI: Easily train a good VC model with voice data <= 10 mins! · GitHub

  • V_Arrow 08-13 19:59
    11

    正解,类似的音色转换还包括so-vits-svc(仓库早已归档)和DDSP

  • AnimalCollective 08-13 20:02
    12

    要求这么高么,我项目就是VoxCPM,感觉已经可以了

  • AnimalCollective 08-13 20:03
    13

    楼主有试到效果好的,可以回来推荐一下 ^-^

  • 秋实 08-13 20:07
    14

    我印象中这种貌似不是很难?RVC 和 GPT-SoVits 都是可以的

  • twomonkeys 楼主 08-13 20:10
    15





    是的,看到 so-vits-svc 归档了, 就去测试了下 applio, 结果练了半天,啥也不是。。。。。

    我用rvc再去试试

  • V_Arrow 08-13 20:16
    16

    我个人接触过so-vits-svc、RVC、DDSP,都练过模型,第一个练的最多,个人经验是so-vits-svc上下限差距很大,如果提供的训练数据质量高,效果基本是最好的,但反之数据量过少、质量差可能练出来一堆噪声。相同的数据集练RVC和DDSP总是电音很重的感觉,可能当数据实在太少的话可以尝试保底

* 帖子来源Linux.do
返回