【已完成两版方案】求问怎么实现实时语音对话功能

shopkeeper 2026-09-10 09:40 1

经过几天的捣鼓,现在也是比较好地实现了家里的codex远程控制手机的能力,接下来我想更进一步,去达成我想实现贾维斯式交互的想法(类似于我能够在手机上跟它进行实时对话、委派任务,它能够调用我的所有资源去实现任务。目前给了它3台vps,1台windows电脑,1台手机。)。


但是目前实时语音服务,以及语音模型怎么跟codex和antigravity进行任务交接的问题还没有什么头绪,我想的是像gpt voice那样的交互体验,有佬友做过类似的项目吗?


目前跟gpt商讨的架构是这样的,不知道是否可行:


下面分享一下我今早在地铁上通过远程控制让gpt帮我生成图片的一个效果:






二编:

汇报一下进度,一开始按照实时语音的方式来做了,具体实现就是,在手机上开发一个app,电脑上开发一个语音服务后端。把千问的实时语音模型配置在了后端上,并封装了两个工具给它,用来连接codex会话和antigravity会话,实现类似子agent的任务派发效果。

这一版整体速度很快,流畅,基本上对话都能实时响应,也能够调度子agent去干活。

但是缺点是什么呢?就是整个系统最大的瓶颈其实是在于实时语音模型的性能,它最多支持50轮滚动对话,上下文太小,而且实时模型这条路线就注定会损失很多性能,无法达到在电脑上直接跟gpt/gemini打字对话的效果。


损失智能其实很多活就不好派发了,为此我尝试了佬友推荐的stt+tts路线。以下是效果图:

最新回复 (14)
  • 09-10 09:54
    1

    直接用ASR项目转文字给codex发过去试试呢

  • shopkeeper 楼主 09-10 09:55
    2

    这样就慢了,我不想做stt和tts,感觉交互体验没那么好

  • 09-10 09:58
    3

    那就一个负责语音聊天的agent,异步调用和监控codex或者别的agent

  • shopkeeper 楼主 09-10 10:00
    4

    是的呀,目前就卡在这一步了。语音聊天这里只用过,但是没有实际做过,感觉gpt6提的方案不太合理,但是又不知道怎么纠正它。

  • Nigel2026 09-10 10:01
    5

    UU远程加上豆包语音输入法,不就可以实现你说的语音派任务的功能了么

  • shopkeeper 楼主 09-10 10:06
    6

    佬,我想做一个自己的,不想用uu远程和语音输入法。更多的是想探索这条路怎么做吧,因为用gpt voice,感觉体验很好,也比较接近自己想的交互方式。

  • YUhome 09-10 10:14
    7

    大部分的方案本质上不还是 stt 和 tts 吗? 除非是用语音一体大模型,不过这就成本大了吧。

  • shopkeeper 楼主 09-10 10:17
    8

    大部分是这样吧,但是我想做gpt voice那种,那个才是未来。

  • imdoge 09-10 10:24
    9

    自己实现和架构?为啥不直接用各家的voice/realtime/live那种实时方案

    看标题和内容不太一致吧,这下面不是主要说远程调度各agent和其他产品吗,实时语音不是为主

  • shopkeeper 楼主 09-10 10:27
    10

    佬,现在就是不太清楚各家的怎么接入呀。要对话,要能调用其他agent。实时语音作为中间人来调度。

  • YUhome 09-10 10:48
    11

    那就设计到调用了,把 chatgpt 做成 mcp? 火山有这样的大模型,但是又多了一层中转和理解,我觉得越搞越复杂了。

  • shopkeeper 楼主 09-12 14:52
    12

    这种方案感觉效果差了点,我又做了stt+tts的,感觉除了响应慢点之外,没啥大问题了

  • shopkeeper 楼主 09-12 14:54
    13

    试了一下,,接一个l实时语音大模型,感觉还是太笨了,又换到了stt+tts的方案,后续只能寄希望于模型的响应速度大幅提升了

  • YUhome 09-12 16:39
    14

    是的,就是本来很厉害的,找了个二货中介来做翻译

    因为我折腾过 ^-^所以还是坚持了 stt +tts

* 帖子来源Linux.do
返回