最近在手搓 智能角色配音引擎 搞定就开源

jeffccie 2026-07-21 01:07 1

框架是以下内容,各位佬看可不可行。已在快搓一半了,优化中。 ^-^


1. 概述


1.1 背景


手动为影视角色配音耗时长、成本高。借助 LLM 的理解能力和 TTS 的合成能力,实现从视频输入到配音视频输出的自动化流程。


1.2 目标


构建一个端到端的影视配音引擎,输入外语视频 + 角色干声文件,自动完成人声分离、语音识别、翻译、配音合成、字幕生成,输出中文配音视频。


1.3 成功指标




































指标 目标值
配音字幕同步率 ≥ 90% (ASR 反查误差 <1s)
TTS 成功率 100%
角色识别准确率 ≥ 80%
翻译质量 ≥ 3.5/5 (人工评估)
1 分钟视频端到端 < 5 分钟
字幕垃圾行 0



2. 用户场景


2.1 主场景:外语影视翻译配音


用户画像: 视频创作者、影视爱好者、内容本地化工作者


用户故事:



作为视频创作者,我有一段外语影视片段和角色干声文件,希望系统自动将其翻译配音为中文,以便发布给中文观众。



输入:



  • 外语视频文件 (mp4/mkv/avi/mov)

  • 角色干声文件 (mp3/wav/flac,每角色一个)

  • 源语言代码 (ko/en/ja/…)


输出:



  • 中文配音视频 (.mp4)

  • 中文字幕文件 (.srt)


典型工作流:


用户提供: movie.mp4 + actor_a.mp3 + actor_b.mp3 + 源语言: ko

1. 音频提取 — 自动检测音轨 → 提取音频
2. 人声分离 — Demucs 去除 BGM → 干声
3. ASR — Whisper 识别台词 + 时间戳
4. 翻译 — LLM 按原片风格翻译为中文
5. 剧本解析 — 角色识别 + 台词归属
6. 基频分析 — 自动分配男/女角色
7. 用户确认 — 角色↔干声绑定
8. TTS — voiceclone 生成中文配音
9. 编排 — 原时间轴对齐 + 背景音混合
10. 输出 — 配音视频 + 中文字幕
最新回复 (8)
  • jeffccie 楼主 07-21 11:51
    1

    进展汇报,还在测试,MVP完成,但配音存在识别问题优化中


    第一期,应该是CPU+API来搞,这样上手会更好点,因为用API限制会比较大。

    第二期,可以本地CPU+GPU来搞 ^-^

  • jeffccie 楼主 07-25 21:27
    2

    进展汇报,碰到几个棘手问题


    1 人物识别不准,人物自动匹配音色不准

    2 外语翻译成中文后文本过长,TTS后会超过时间槽,现阶段处理方式 a 精简翻译, b 加快语速 均不理想。


    以上两个问题还在解决中

  • ai_do 08-27 00:01
    3

    佬,整完了么 我当你首批测试用户八 哈哈

  • jeffccie 楼主 08-27 00:02
    4

    还在整,现在还是碰到人物不准的问题 ^-^

  • 空城 08-27 10:38
    5

    佬我也在搞这个,可以一起学习交流下呀

  • chenzhiming960 08-27 10:42
    6

    我也想加入开发车队,我是想将英文小说和漫画转化为一句中文一句英文的文章用来听

  • jeffccie 楼主 08-27 18:37
    7

    等出个demo,现在自己都不太满意,再等等

  • jeffccie 楼主 08-27 18:38
    8

    是 英文一句,中文翻译一句吗,像地铁播报一样?

* 帖子来源Linux.do
返回