好奇想了解豆包、GPT 语音实时对话是如何做的,体验上除了智能外,其他因素还蛮多的。

rangoBen 2026-09-09 18:00 1

自己想做一个产品,跟这个紧密相关。


早在 23 年 GPT 刚发布的时候,我用它当时的 Whisper 模型尝试过,基础体验很差(很明显,当时的技术还不成熟)。


现在我体验豆包、跟 GPT 的实时语音聊天,感觉已经非常好了:语气、延时、对用户打断的判断、实时的智能输出。


我跟 GPT 最新大模型聊了大概几天,最后的方案简单描述就是:



  1. 客户端收集录音并上传至语音模型服务,获取文字解析结果(输入内容可能是模糊或复杂的,所以需要语言模型识别,而不是单纯的语音转文字)。

  2. 将文字结果加上特定上下文,发送给语言模型,获取回答。

  3. 将回答发送给语音模型获取音频,并播放给用户。


这种方案会有很多细节需要注意,例如延时、用户打断、意图判断、上下文管理等。


延时也会很高,所以想请教:还有其他方向吗?

最新回复 (0)
    没有回复
* 帖子来源V2EX
返回