在无人在意的角落,微软发布了 mai-transcribe-2

fjhorn 2026-09-05 10:36 1

发布两天了,发现站里还没人提过 ^-^

号称是自家上一代速度的两倍。笔elevenlabs的又快又好又便宜。正在测试中……




初步测试结果:

非常好。大概是主流STT目前最快的了。而且支持word level时间戳、发言者识别,多语言。


不支持实时转码,最大的缺失。

另外测试发现diarization不太稳定,容易报错。还有进步空间


打开时间戳的功能,识别速度减半。再加上diarization,就容易timeout了


我是用azure调用的。


更新3:这一版也支持直接去除简单口癖。和gemini transcribe类似。

总之,完全满足我的所有要求。微软终于牛逼一把!

最新回复 (19)
  • skad 09-05 10:43
    1

    期待开源试下,看着还不错

  • fjhorn 楼主 09-05 10:48
    2

    刚才试了一下,确实飞快。体感明显比我用过的所有的stt都快,包括gpt transcribe,gemini 3.5 transcribe,elevenlabs的v2


    和soniox realtime差不多,但是效果更好。

  • dhgdtdtbff 09-05 10:50
    3

    看到过了,从跑分来说很不错,还没实际用过

  • fjhorn 楼主 09-05 11:08
    4

    我试了一下,非常好。word level时间戳、发言者识别,速度爆裂。


    完全满足我的所有要求。微软终于牛逼一把。

  • neteroster 09-05 11:09
    5

    这个支持实时转写吗,好像写的不是很清楚

  • fjhorn 楼主 09-05 11:11
    6

    好像不支持。是最大的痛点把。


    另外测试发现diarization不太稳定,容易报错。还有进步空间

  • 小飞侠 09-05 11:11
    7

    这个是不是只能通过比如azure的api付费才能使用到啊

  • fjhorn 楼主 09-05 11:11
    8

    我用azure调用的。其他渠道不清楚

  • 伏黑甚尔 09-05 11:12
    9

    确实无人在意,都被GPT6抢了风头 ^-^

  • fjhorn 楼主 09-05 11:17
    10

    用这个嘴子指挥gpt 6比codex内置的语音识别速度快,哈哈

  • BOOSTMEISTER 2014 DH 09-05 11:29
    11

    image 2.6 也发了吧。确实没热度

  • learner063 09-05 11:37
    12

    准确度真的比 elevenlabs 的好吗

  • learner063 09-05 11:41
    13

    我主要用于播客转录,对于专有名词,多讲话人识别都有要求,我之前测过了一下主流的,发现 elevenlabs 的效果最好,等等我也去看看这个

  • ただヤンシャオに過ぎない 09-05 11:44
    14

    微软,你崛起吧(

    之前还看到几个进arena的微软模型,都有不错的文本能力

  • 路人A 09-05 13:21
    15

    刚出的时候就试过了,一般吧,

    同是Microsoft却没有继承VibeVoice-ASR优秀的多人识别效果。

  • sallyn 09-05 13:31
    16

    佬测试的是什么语言?最近还是用scribe v2和qwen3asr比较多,前者外语后者中文,但是前者成本还是比较高(虽然可以免费账号多开几个走API)其他几家比较火的ASR感觉小语种效果不是很好

  • fjhorn 楼主 09-05 13:34
    17

    中英文混输。


    微软自己有比较各种语言,可以参考一下


  • sallyn 09-05 17:49
    18

    从Azure试了一下 不知道为什么 一旦音频超过了20min之后就开始报500错误 找了半天文档也死活找不到哪来的问题 其他都挺好的 这个字词级别的时间点一次出的我都不用去修时轴了

  • MineMine 09-05 18:02
    19

    什么时候替换 Windows 内置的 Win+H 的语音转录

* 帖子来源Linux.do
返回