【开源】Rust 字幕工具: SubForge,从转录、翻译到烧字幕一条命令完成【win 和 Linux 已验证】

nightraider 2026-05-31 17:41 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出




前言


最近在看外国课程,但奈何本人英语水平有限,机翻的字幕又简直灾难,于是参考各种方法做了一个还不错的工具,安装使用都很清晰(详见README.md),欢迎各位佬友品鉴


效果图:






正文


流程:


视频 / 音频

→ 语音转录

→ 智能分段

→ 字幕翻译

→ 质量评估

→ 硬烧字幕 / 软封装字幕


核心特点




  • Rust CLI,跨平台(Linux和Windows已验证),支持Linux/macOS/Windows




  • 本地 faster-whisper 转录,支持 GPU




  • SaT 分段,尽量改善字幕断句




  • 支持 Google / Bing / LLM 翻译




  • 支持术语、翻译记忆、质量评估和低分重翻




  • FFmpeg 硬烧字幕,也可软封




常用的命令只有一条


subforge process video.mp4


只想生成字幕,不烧录可以


subforge translate video.mp4


项目地址:


最新回复 (19)
  • Frankorz 05-31 17:50
    2

    佬友牛逼!晚会试试看!不知道要不要下模型

  • nightraider 楼主 05-31 18:03
    4

    asr模型的话,如果没有,他会有提示,自动就可以下的

  • xiaoyutx 05-31 18:18
    5

    佬,这工具吃配置么?需要啥样的显卡才能跑起来。

  • nightraider 楼主 05-31 18:20
    6

    得看模型选什么,英语我一般用small.en,这个一般笔记本(我的是5060)都能跑,而且占用比较低

  • Tairitsu 05-31 18:23
    7

    本地 faster-whisper 转录,支持 GPU



    之前单独用whisper的时候感觉识别还是很怪,而且没法识别几种语言混在一起的

    以及比如说如果发给gemini的话能自动根据上下文纠正一些词,但是这种传统小模型就没办法了

    但是gemini现在又整的很一般,长音频基本都会漏句,不知道什么时候能回到2.5水平

  • nightraider 楼主 05-31 18:28
    8

    嗯呢,目前用的顺手的依然是很久都不更新的whisper,可能也没人关注这方面了吧,佬友们有好的模型可以推荐推荐

  • 獭栖八雫 05-31 18:36
    9

    很好的工具,模型方面佬可以看看Fun-ASR-Nano

  • kkmomi 05-31 18:52
    10

    可以不在本地跑,直接用STT的api吗

  • nightraider 楼主 05-31 19:06
    11

    可以的,OpenAI-compatible就可以


  • 猎奇分子 05-31 19:14
    12

    有个朋友让我帮他问问可以自动生成那种视频的字幕吗

  • tyzones 05-31 19:36
    13

    这个纯CPU可以跑起来么?正好想给旧机加点活

  • nightraider 楼主 05-31 19:38
    14

    是可以跑的, 只是会慢一点, 佬

  • crystalwayne 05-31 19:41
    15

    可以,挺好用的,主要是我目前很懒,还在走沉浸式的懒人路线,看个技术类的视频,有些单词太偏门了不是很好理解,非技术类的还是可以直接生啃不需要字幕翻译的

  • Re2025 06-01 10:08
    16

    最近刚好想vide一个类似的,刚好省去了再造轮子!

  • relienidema 06-01 11:25
    17

    让你朋友谢我。


    `前缀ghub/meizhong986/WhisperJA**为键盘B左边的字母)` (为啥要审核,改了好几版了)


    我朋友亲测好用。

  • fx318 06-01 13:08
    18

    厉害厉害,佬友真是太强了,支持一下

  • Meta 06-01 14:01
    19

    没啥别的意思,就是问问,有测过在不正经ASMR里好用吗

  • nightraider 楼主 06-01 14:54
    20

    原理上来说, 应该没有不能用的地方 ^-^

  • Meta 06-01 14:55
    21

    我目前在用Qwen3-ASR-0.6B的原模型进行测试,发现类似NHK的播报很准,但是类似ASMR或者歌曲的女声经常被忽略,直接让Qwen3-ASR自己的VAD工作可以正常捕获,但是生成质量一般(主要是断句太极端了,导致语义变了) ^-^

    然后我刚又看了一下这个项目,发现我不太适合接入我的玩具里,我在做一个实时字幕的玩具,如果用了它的方案还要加点延迟,我感觉接受不了 ^-^不过不是实时的话应该不错

* 帖子来源Linux.do
返回