就是类似于 GPT 的 Live 模式,原生就是支持语音,而不是先把语音转成文字,再用文字输入输出的模型,这样可以整体识别,误识别率会低一点,处理时间的效率也会高一点 ^-^
豆包 ^-^
@OPlin #1 豆包又好像有点太蠢了 ^-^ ,而且我记得豆包好像是有语音转文字的,也有普通的文字转文字的语音模型。但是原生语音这种支持嘛