有需要用到Whipser的需求,哪里可以获取?

Ein 2026-08-27 02:59 1

因为一些成人之美的缘故,想用Whisper模型进行性一些转录操作。


不过不知道本地的Whipser和Whipser API哪个好用?还是说都只是看最后的具体模型?

本地的话有没有性能要求呢?


如果有佬了解有API可以用的话可以讲讲喵,难道只能买官API?

顺便在转录上还有没有比OpenAI的Whipser更强力的模型推荐?


应用场景可能就是简单的转录,可能会批量。

最新回复 (6)
  • 美帝码工 08-27 03:03
    1

    本地跑就可以。转录结果转交给 LLM 做基于上下文语义的修正。

  • beautifulrem 08-27 03:03
    2

    看你的场景了,至少中日转录Whipser不太行,主要是幻听问题比较严重。


    还有要带时间戳的话,Whipser也不行,时间戳漂移也很严重

  • Ein 楼主 08-27 03:04
    3

    是的,我尝试了一下小模型和中等模型,效果不理想,而且本地跑有点慢慢的。

  • 美帝码工 08-27 03:07
    4

    幻觉严重的原因是因为空白内容太多了。

    可以裁剪不同的时间间隔,做对照。

    我一般 gpt-transcribe + whisper 对照,5 分钟一组,30 分钟一组,对照

    最后 LLM 做语义修订。纯转录模型一般是内部30秒滚动,缺少大局观。


    不追求最高精确,追求快和质量平衡,可以用 fireworks 提供的 whisper,几秒就能转录一小时音频。

  • beautifulrem 08-27 03:07
    5

    你不需要时间戳的话,Gemini-2.5-pro的转录(多模态)目前的最强的,比后面的哈基米都能打。


    需要时间戳的话就哈基米转录+Qwen的ASR(中文日文的话),英文的话英伟达有一个ASR对齐模型。做对齐比直接转出来时间戳稳定多了。这个是我混迹一些做日文ASMR的LLM翻译的圈子,基本上得出来的最好结果。


    最近两年的其他转录模型比Whisper没好多少。不过你也可以试试谷歌和OpenAI的一些最新的转录模型,api调用都是,我看谷歌这两天还新发了一个。

  • W1nge 08-27 03:28
    6

    我现在是2080ti,用的mimo asr 7b q4量化

    识别速度非常快,在音频时长的1/13左右,堪比云端

* 帖子来源Linux.do
返回