录音转文字现在什么最好?中英文混杂

Sunrise 2026-09-04 16:15 1

大概是去年开始用通义,但是今年到目前为止,感觉这模型就完全没进步,很多识别精度实在是太低了

最新回复 (5)
  • chongyang 09-04 16:16
    1

    微软的Speech service 佬友有试过吗

  • moni 09-04 16:25
    2

    我前司的做法是,先通过ASR识别出来以后,在把识别出来的,带上上下文,让AI去润色调整一下,效果能好一点

  • T 09-04 16:44
    3

    本地直接说话录音可以豆包输入法,asr模型推荐qwen3-asr-1.7b,量化版本看本地设备能力。

  • liang 09-04 16:46
    4

    我之前都是写个脚本,调用硅基流动的API免费转成文字 再二次润色

  • Sunrise 楼主 09-04 17:14
    5

    这显卡显存需求太高了吧,我就自己用一下记录

* 帖子来源Linux.do
返回