做了个把多人录音按说话人拆成独立音轨的工具

goingglobal 2026-08-31 21:30 1

最近做了一个小工具 Seply ,主要解决多人录音里的说话人分离问题。


这里的“分离”不是只在文字稿里标记 Speaker 1 、Speaker 2 ,而是上传一段播客、采访或者会议录音后,实际生成每位说话人的独立音轨,并且保持和原录音的时间轴对齐,方便后续剪辑、转写或者单独处理某个人的声音。


最开始做这个功能,是因为我发现很多 diarization 工具只能告诉你“谁在什么时候说话”,但如果想真正拿到每个人的音频,仍然需要手工剪辑。


目前主要支持:


上传音频或视频
自动识别或手动设置说话人数
为每位说话人生成独立 WAV 音轨
普通对话和重叠语音两种处理模式
另外做了带说话人和时间轴的语音转文字功能


实际做下来,最难处理的还是多人同时说话。


普通轮流对话的分离效果相对稳定,但遇到抢话、打断或者两个人同时说话时,很难做到完全干净。我后来增加了一个针对重叠语音的 Advanced 模式,效果会好一些,但处理成本也高很多。


所以现在产品里保留了两个模式:


Standard:适合大多数轮流说话的播客、采访和会议
Advanced:适合重叠说话较多、对分离质量要求更高的录音


我没有把它宣传成“可以完美消除重叠语音”,因为实际效果还是会受到噪声、回声、录音设备、声音相似度和重叠程度影响。


网站在这里:


https://seply.org/


新用户有 30 Credits ,可以免费处理最多 3 分钟的 Standard Separation 。网站目前主要面向海外用户,所以界面是英文的。


想请大家主要帮我看看几个问题:


打开首页后,能不能比较快地理解它和普通说话人识别、语音转文字的区别?
Standard 和 Advanced 两个模式会不会让人觉得选择比较复杂?
如果你处理过播客、采访、会议或者多人视频,最希望导出哪些结果?
定价和 Credits 的表达是否容易理解?


目前还是一个比较早期的版本,会持续迭代。

最新回复 (0)
    没有回复
* 帖子来源V2EX
返回