请教下现在 app 端语音转文字 sdk 哪个好用些

SilenceLL 2026-09-01 09:28 1

我们现在是用的百度的,产品觉得效果不好,又不想去每个 sdk 重新测试一遍。请教下大家实际使用哪家的方案比较好?

最新回复 (21)
  • neteroster 09-01 09:32
    1
    中文豆包和千问都还可以(千问语音产品线很乱建议都试试)

    多语言 soniox 和 elevenlabs
  • john990 09-01 09:34
    2
    不想自己试可以让 AI 做啊,它还会用测试集,并且自己打分
  • SilenceLL 楼主 09-01 09:40
    3
    @john990 这个咋测,是搞一批音频文件,然后让 ai 接各种 sdk ,然后测每个的识别效果吗
  • QS0x01 09-01 09:50
    4
    @SilenceLL 搜 ASR 方向的测试集就行,或者直接看千问 ASR 论文使用的测试集。
  • john1024 09-01 09:56
    5
    lazytyper 通义千问,火山的豆包语音
  • William337 09-01 10:23
    6
    不知道 whisper 适合你不?
  • SilenceLL 楼主 09-01 10:45
    7
    @William337 国内也能用吗
  • capric 09-01 10:46
    8
    funasr
  • dcatfly 09-01 10:58
    9
    https://huggingface.co/spaces/hf-audio/open_asr_leaderboard
    https://artificialanalysis.ai/speech-to-text/non-streaming
    你可以参考这两个榜单,不过感觉 aa 的榜单有点不准。
    大体上中英文可以 qwen-asr ,其他语言可以 whisper 。
  • maotong 09-01 11:46
    10
    https://github.com/k2-fsa/sherpa-onnx
    肯定是这个了。 里面有些训练好的模型可以直接用。全平台支持。
  • nocmt 09-01 11:55
    11
    可以看看我的软件,https://subflowai.nocmt.com/

    目前是支持端侧模型,跑 STT 和 LLM 翻译的
  • taken 09-01 12:00
    12
    流式的话,国内大厂:
    首推腾讯,服务好响应快
    其次就都差不多了

    讯飞>字节>阿里
  • dingwen07 09-01 12:11
    13
    系统内置的
  • feifei1210250 09-01 14:08
    14
    常规中文的话用 Fun-ASR-Nano-2512 ,识别效果和速度都比 whisper 要强很多,

    但带背景音乐的中文影视作品用前者会有幻觉,经常会会有“哈哈哈”之类的完全无关的识别结果,仍是 whisper large-v3-turbo 比较合适
  • Nasdaq 09-01 14:09
    15
    Fun-ASR
  • junyiwork 09-01 15:22
    16
    中文的话,火山引擎或者阿里云的 ASR 都还不错。
  • declandragon 09-01 15:25
    17
    是实时语音转文字还是音频提取字幕?音频提取字幕用了阿里的
  • DICK23 09-01 15:41
    18
    我用的腾讯的 asr
  • KisekiRemi 09-01 17:34
    19
    推荐腾讯或者讯飞的
  • William337 09-01 18:13
    20
    @SilenceLL 开源的为啥不行,目前用这个做字幕,还没有比它体验更好的,目前。但是我是本地 Windows 跑的,你要调研一下是否有移动端版本
  • woaigeny 09-01 18:48
    21
    用的讯飞的,识别效果还行
* 帖子来源V2EX
返回