腾讯开源语音生成和编辑模型AuK 发布即SOTA

fengchris 2026-09-09 16:21 1

官方博客:https://auk-project.github.io/


1.5B的模型,支持TTS、音色克隆、音色设计和编辑、音频内容编辑、音频增强和分离、情感转换等各种语音任务。



仓库:GitHub - Tencent-Hunyuan/AuK: AuK: An Open-Source Foundational Model for Speech Generation and Editing · GitHub


权重:























模型 描述 权重
AuK 基础模型 ^-^ Hugging Face · ^-^ ModelScope
AuK-Flash 蒸馏模型 4步快速推理 ^-^ Hugging Face · ^-^ ModelScope

最新回复 (7)
  • Sokeu 09-09 16:29
    1



    这是github.io被标记了么

  • fengchris 楼主 09-09 16:30
    2

    我这chrome没提示唉

  • surick 09-09 16:33
    3

    如果freeswitch和asterisk通过MRCP接入这种语音模型,后面客服行业是不是完全不需要人工坐席了

  • 七玉 09-09 16:35
    4

    这个不知道比起indextts2.0和2.5来说怎么样

  • 09-09 16:42
    5

    跑了下官方示例的案例,带语气生成的很怪,总体还行吧

  • ttaidazi 09-09 17:31
    6

    chrome是

  • deepcake 09-09 17:52
    7

    Demo是真屎,完全看不出来怎么用(连我这种尝试很多TTS Demo的人)。


* 帖子来源Linux.do
返回