M 芯片 Mac 本地语音文件(m4a wav aac 等文件)转文字有什么好的方案吗?

djy 2026-09-06 15:29 1

主要是把一些录音转成文字发给 AI 用。


录音一般都是普通话、英文,偶尔有几句中国方言、日语。


中国方言、日语是比较次要的,如果做不到可以忽略。中英文足够好也够了。


有没有什么精度比较高的方案?


用了苹果电脑自带的转录,转出来很垃圾,识别的非常差,没法用。

最新回复 (8)
  • 苏白城 09-06 15:30
    1

    力推 Qwen3 ASR

    混合多语种识别效果不错

    M 芯片本地 mlx 可以很方便配置跑起来

  • Nigel2026 09-06 15:42
    2

    cohere有个模型还可以,速度很快,据说一个小时可能也只要几十秒就能转好

  • Nigel2026 09-06 15:42
    3

    应该是需要ASR吧,不是TTS

  • huangjiecs614 09-06 15:44
    4

    直接丢给codex转就好 它自己会下模型转完还会校对 经常拿来转播客

  • 苏白城 09-06 15:46
    5

    对 (òωó)^-^ 是 Qwen3-ASR-1.7B

  • 0xEcho 09-06 15:50
    6

    我用的是whisper.cpp的large-V3-turbo模型,针对mac有优化,实测转录出来精度还可以,个别术语不行需要纠正,Qwen3-ASR 0.6B也可以,但是个人不太喜欢,断句有问题,术语识别率更低,个人体感不如whisper.cpp

  • bmin 09-06 15:54
    7

    英文速度最快质量也相对不错的是parakeet-tdt-0.6b-v2,比 Whisper 模型快 15-17 倍,追求最好的质量的是 Whisper-large-v3。


    日文唯一的选择是 Whisper-large-v2


    中文相对比较好用的还是 Qwen3-ASR-1.7B + Qwen3-ForcedAligner-0.6B


    以上都可以用 mlx 版本

  • zspor 09-06 16:31
    8



    推荐typewhisper,可以本地安装不同模型试验下效果

* 帖子来源Linux.do
返回