对于一款语音输入软件的新认识

Ayuan 2026-09-04 23:31 1

之前我一直以为闪电说这款软件的全面回忆是能够自主沉淀内容的,也就是能自主沉淀词典、技能或画像,就像我自己给 Codex 或 Claude 设置的 hooks 一样,经过多轮对话有 continuous learning 的能力。


但今天才发现它似乎根本没有,它只是一个回顾功能,能找到前几天之前的截图。它似乎根本没有自进化的功能。我今天去看了这个项目的源码,才发现它根本没这个功能。


那就代表我前面用全面回忆去截图,之前为它配置多模态,为了养这个,发现似乎没什么太大用处,好像白白花了很多多模态模型的钱。感觉自己有点蠢,稍微有点难受。


因为这个一直宣传的是它能越来越懂你,就是说它会沉淀内容。它这个全面回忆,会越来越懂你,然后沉淀内容、沉淀词典、沉淀风格、沉淀个人画像,然后还有技能。但是后来发现,哦,哎,然后我就一直没有想着去看,就一直相信。但是现在发现其实没有。


然后自己有一个想法,就是说如果将这个全面回忆的内容接入 Hermes,把 Hermes 接入进去,它会不会就有那种功能?但是像这种沉淀,我发现好像又不是太可控。就是说,如果我想让它沉淀,那肯定是整体需要一个可控的过程。只有经过多轮严格的筛选,才会沉淀出一个词典或者一项技能。但是如果说是 Hermes 的话,就像这个 10 轮沉淀一次,好像又不太对,感觉又不太对。

最新回复 (10)
  • Demorain 09-04 23:36
    1

    codex的memory.md是佬说的想法吗?类似的感觉?

  • duroey 09-04 23:39
    2

    那会把语音输入法做得越来越像一个 Agent。问题是到底是做语音输入法,还是做 Agent?

    产品或者工程上,或许是在做这两者的 trade off。但是算法上的全模态模型驱动harness,直接从根本上进行语音输入或许是更好的答案

  • killer 09-04 23:40
    3

    各家的 memory 功能实际上做得都很垃圾,不是很好。无论是 codex 也好,还是其他的也罢,都是一样的,都不建议打开。


    具体的理由可以去看 Matt Pocock 的课,我觉得他的一些课说得比较好。比如说,一款模型的聪明区只有 200K,你如果 memory 就占了几十K,那很明显模型会变得更笨


    所以说,memory 或者说 agent.md 这些,应该主要是让人手工去写,而且越少越好。否则的话,很有可能是负优化,就是你 memory 记忆里面有大量的乱七八糟的东西,不一定会变得更聪明


    当然了,你要是说让模型越来越懂你,那么确实,你 memory 里面放得越多,那肯定越懂你


    对于一个语音软件来说,我觉得类似于 Typeless 这种提取出关键词作为词典就已经到极限了。如果你还要做得更多的话,我觉得反而是负优化

  • 席乐 09-04 23:51
    4

    我希望有个 AI 能够自动导入我通讯录的名字。打字要打到名字的时候,只能手打。

  • Ayuan 楼主 09-04 23:53
    5

    这个好像,如果是微信的话,感觉可以做到吧。


    就是获取微信联系人的信息,然后导入到这个语音输入软件里面,再强制一点,加上文本正则化,基本上就不会出问题了。

  • 席乐 09-04 23:55
    6

    我觉得没那么容易。

    因为 AI 的字是从服务器返回过来的,本地识别的优先级会比较低。

    ASR是声音变文字,不是文字变文字,正则没什么用。

    要么他把我的通讯录全上传到服务器。

    要么在本地就要实现一个高优先级的 ASR 修正,没那么容易

  • Ayuan 楼主 09-04 23:56
    7

    也是,我觉得 memory 可能不会越来越多,memory 就是要更精细化。但我觉得更多的是平时在日常使用中,一段时间可能在做一个项目,那这个项目的语音输入过程中应该会有很多关键词,是可以不用了的。


    那在我们一开始进行语音输入的时候,还有可能会语音输入错误,这时候就会识别到。像这种如果能接入的话,我想它更多是会沉淀,一个项目沉淀出对应的词典,一个工作流会有一个对应的词典。


    像现在目前他这个全面回忆,截了很多图,有时候会截多张图,但它只是把东西放进去。对于我直接说,它也不会采取我近期已经输入过的记忆,不会采取截屏的记忆。所以目前我发现,开了全面回忆它也做不到能用到里面的东西,就像是一个垃圾堆。


    我之前一扫,发现全面回忆的目录已经储存了 70 多 G 的文件,但今天我才知道这些基本上都没什么用,平常根本就没用到,让我很难受。


    我更想的是,不是去沉淀 memory,因为我觉得 memory 还是比较难的,比较难沉淀。只有说是真正的,可能 memory 也不行吧,更多的是沉淀技能。但实际我在用语音输入的时候,这个又用得不多。


    所以我主要的还是需要去沉淀词典。

  • Ayuan 楼主 09-04 23:58
    8

    主要是这个,它一开始宣传的就是能够越来越懂你的语音输入的 Agent,而不是一款单纯的语音输入。然后就让我误解成了,它是能够根据我输入的这个全面回忆,然后能够越来越了解我。但实际上,真正的还是需要自己去设置风格,自己去设置 memory,然后自己去沉淀词典。我之前以为这些都是能够自动化的,因为它打的是 Agent 的那个宣传。

  • killer 09-04 23:58
    9

    那在我们一开始进行语音输入的时候,还有可能会语音输入错误,这时候就会识别到。像这种如果能接入的话,我想它更多是会沉淀,一个项目沉淀出对应的词典,一个工作流会有一个对应的词典。



    Typeless 已经可以做到了,我现在用的就是 Typeless 在和你讲话。当它发现有些词汇使用语音识别经常识别错误的时候,会自动帮你提取出相应的词典。


    我觉得这是工程化的取舍吧。做成你说的那样其实非常不可控,不确定因素太多了;而它做成这种词典的形式,既保证了正确率,也让整个项目的可控性更强一点

  • FlyLoongZ 09-05 00:23
    10

    其实是可以的,像x-asr这样的本地模型可以在手机上部署应付一般的语音输入,而且x-asr还支持标点输出和词典设置

* 帖子来源Linux.do
返回