求大家认为的最好用的OCR、ASR、TTS解决方案

yaolan 2026-08-27 12:50 1

大家目前用过的最好的OCR、ASR、TTS解决方案是什么呢?目前市面上开源、商用的解决方案太多了并且良莠不齐,想听听大家的看法。

最新回复 (7)
  • goodjob32 08-27 13:13
    1

    ocr可以试试paddle ocr, asr用whisper?

  • peiyangium 08-27 13:16
    2

    whisper不太行,还不如qwen-asr。但我觉得qwen-asr也不尽善尽美。

  • huahai23 08-27 13:20
    3

    asr和tts我都用qwen家的,还不错。

  • Logic Tan 08-27 13:21
    4

    ocr:gpt/gemini多模态

    asr:本地funasr,api用gemini多模态

    tts:不管别家吹的多牛x,vibevoice 7b yyds(仅限音色克隆场景)

  • neteroster 08-27 13:23
    5

    ocr:一般图片直接大模型,pdf论文 doc2x

    stt:soniox v5 rt + async / qwen 的也还不错

    tts不太了解就不多说了

  • 赚钱买奶粉 08-27 13:28
    6

    ocr: paddle、hunyun、deepseek,我感觉都差不多

    asr:funasr,qwen3ar 也不错,但稳定性没有 funasr 稳,特别是时间戳

    tts:indextt2,2.5 还没试过。其次 VoxCPM2,但 VoxCPM2 不够稳定。qwen3asr 和 cosyvoice3 一个水准,多语言强,但情绪表达一般般。

  • Kiana Kaslana 08-27 13:29
    7

    asr:qwen-3 asr


    具体的内容:ASR 模型选型实战:从一段全是噪音的录音说起 - 赵培州

* 帖子来源Linux.do
返回