折腾一段时间后,今天发现了杀死比赛的 Mac(Windows)语音输入方案

Zhaogang 2026-09-27 11:07 1

软件:GitHub - Open-Less/openless: Hold a key, speak, release — AI-polished text appears at your cursor in any app. Open-source voice input for macOS & Windows. (按住快捷键说话,松开即得润色后的文字) · GitHub

ASR模型:qwen平台的 qwen-audio-3.1-asr-flash-message


目前唯一缺陷是,openless支持wss访问的模型似乎走的是某种白名单,只能让ai为你写一个中转层,把qwen-audio-3.1-asr-flash-message映射到一个白名单模型上


openless内关闭润色模型,在中转层传递


"disfluency_removal_enabled": true,
"intermediate_result_enabled": true

上二参数分别是


识别的同时进行润色,实测口水词能100%去掉、轻度逻辑不清晰的语句,能够为你很好的补全句子要素。大部分大字的时候懒得打,但是会让语义更清晰的标点,也会为你补齐。


中间文本实时推送,类似之前流式模型的感觉,一边说话一边把转写的内容缓存到openless内,实现一松手立刻出字的效果




这样一套配置解决了三个痛点



  1. 实测语音识别准确率高的吓人,基本能想什么说什么,很复杂的多语言场景也能胜任,完美识别你说的原话的同时,能帮你把文字的可读性提升

  2. 速度快的批爆,松手到出字大概是200~700ms左右,基本上无感,松手即出字

  3. 成本很低,大概是3.0-streaming模型的四成价格,还未计算以前的润色模型开销

最新回复 (4)
  • overload7 09-27 14:13
    1楼

    跟同是开源的Fluid Voice如何对比?

  • Zhaogang 楼主 09-27 14:34
    2楼

    我之前检索信息的时候,好像忽略了这款软件,让我先体验一下。

  • Zhaogang 楼主 09-27 14:51
    3楼

    哦我知道当时为什么忽略了,在做调研的时候,我只看了接入第三方asr api的工具,没有关注本地部署的产品,没体验过,不做评价

  • 鹅鹅鹅 09-27 14:54
    4楼

    ARK模型推荐用哪个呢

* 帖子来源Linux.do
返回