截至2026.9.17,开源音频和视频模型性能最好的是哪个?

月下清风蝉鸣 2026-09-17 18:23 1

佬友们,截至2026.9.17,开源音频和视频模型性能最好的是哪个?

最新回复 (6)
  • xiaonuozi 09-17 18:26
    1

    视频模型应该是seedance2和seedance2.5.音频我现在是通过视频一起出的

  • Polar Bear 09-17 18:31
    2

    审题啊佬友 开源模型

    seedance要是开源就好了 ^-^

  • lofrienger 09-17 18:32
    3

    minimax h3吧,社区很活跃

  • joeyblue 09-17 18:47
    4

    视频是 SeeDance 系列了,音频的话,TTS/STT 火山引擎的不错

  • yricky 09-17 19:04
    5

    seedance在哪里下载啊,找不到

  • Stopitazhu 09-17 19:11
    6

    视频模型开源的最好的是H3了吧。音频中文可商用的话是indextts2,英文单从克隆角度可商用的应该是qwentts或者小米的omnivoice吧。英文如果只是听小说kokoros也不错,chatterbox也还行吧。根据ltx提取的音频有两家如果抽卡的话情绪不错,但是不推荐,因为都是工作流,ltx音频不确定性太强。除非对tts情绪要求特别高

* 帖子来源Linux.do
返回