谷歌发布语音转文本模型Gemini 3.5 Transcribe

Dannniel 2026-08-27 01:13 1



看了官方的demo


有几个亮点:



  1. 在噪音环境中可以比较准确的识别文字

  2. 多语言转写可以无缝切换,支持85种语言

  3. 对复杂的电话号码,邮政编码和订单号识别的更准

  4. 自动去掉语气词,并将文本添加标点和格式(?)

  5. 支持自定义词汇表


又一堆startup要死了?

最新回复 (10)
  • Adeir 08-27 01:14
    1

    谷歌除了3.5pro什么模型都发 ^-^

  • 🌟𝗦̘̚𝘂̘̚𝗽̘̚𝗲̘̚𝗿̘̚𝗻̘̚𝗼̘̚𝘃̘̚𝗮̘̚ 08-27 01:14
    2

    speech to text是语音转文本吧,好像写反了




  • aionfatedio 08-27 01:14
    3

    有没有佬测测新模型怎么样,ASMR使用场景,一直在用whisper的社区特化版本

  • 路人A 08-27 01:16
    4

    试了预录版,效果一般差不多等于Soniox吧,能排前游但没新突破,Live没测

  • Swiftlance 08-27 01:16
    5

    瞌睡到了送枕头。这几天正在寻找和对比听写模型。

  • duckgun 08-27 01:17
    6

    天天整这些花里胡哨的,也不赶紧把自家大模型训练好点

  • Dannniel 楼主 08-27 01:17
    7

    确实一不注意写反了,谢谢佬,我改下post

  • Mozi 08-27 01:20
    8

    终于有专门的语音识别模型了

    不用把通用模型改成语音识别了

  • 無光 08-27 01:26
    9

    已经上线studio了,还可以啊

  • fablia 08-27 01:53
    10

    终于有多语言混合转录的了

    之前直接用Gemini效果就很好,但是音频一长就开始幻觉

    来试试这个

* 帖子来源Linux.do
返回