MiMo-V2.5-Pro-UltraSpeed发布,万亿参数(1T)旗舰模型,最高突破 1000 tokens/s 推理速度

ZackWill 2026-06-08 23:25 1



小米今日发布 MiMo-V2.5-Pro 的 UltraSpeed 体验模式,万亿参数(1T)旗舰模型,最高突破 1000 tokens/s 推理速度,为极致实时场景而生。


资源有限,每日限量审批,优先面向专业机构开放。申请链接


模型价格





推特原贴



技术解析




claude分析


模型评测



速度展示


https://mimo.xiaomi.com/mimo-tilert-1000tps/snake.gif(图片大于 4 MB)


https://mimo.xiaomi.com/mimo-tilert-1000tps/1000tps_macos.gif(图片大于 4 MB)


一些其他信息


技术与TileRT团队合作完成



将在抱抱脸开源

最新回复 (19)
  • traveller 06-08 23:25
    1

    ??小米是觉醒了什么天顶星科技吗

  • calendar 06-08 23:26
    2

    三倍价格 + 量化,不用也罢……

  • 土豆教主 06-08 23:27
    3

    ????从哪里突然掏出来的??我的妈耶,这简直是…天花板了?

  • 3qu 06-08 23:27
    4

    投机解码应该会影响性能的吧,不知道小米怎么做的

  • HLiny 06-08 23:28
    5

    fp4量化,模型本身能力也欠佳,有点鸡肋,等等新模型再说吧

  • Gongyi_Churen 06-08 23:29
    6

    等一手佬友测试,不过不太在乎速度的话是不是无所谓他这个

  • 路人A 06-08 23:29
    7

    没用,跟GLM 5.1 UltraSpeed、Cerebras Kimi K2.6 一样,只开放给企业,还是降智版的


    什么时候能开放给个人用户再说吧

  • 前原圭一 06-08 23:31
    8

    可惜了不是原价,贵三倍,如果能维持原价就无敌了

  • 时雨雪 06-08 23:33
    9



    ^-^小模型的极速输出或许挺有用,比如高及时性需求的的小任务?

  • ZackWill 楼主 06-08 23:35
    10

    我已经提交申请了不知道能过不,不在乎速度用原版就行还便宜

  • kerfa 06-08 23:35
    11

    本来就不聪明,量化完还能用吗 ^-^

  • WolfHolo 06-08 23:37
    12

    有种5.3-codex-spark 的感觉了 牺牲智力换速度

    但也算是未来可期

  • ZackWill 楼主 06-08 23:38
    13

    还有就是在人车家生态下的部署,非常需要极速推理。谁都不希望一句小爱同学需要十秒回应吧(

  • alan_wang 06-08 23:38
    14

    感觉比之前GLM5.1高速版看着还爽,直接起飞啊

  • zhengcheng001 06-08 23:39
    15

    三亿的大佬在哪里,我想尝尝先,三倍差距有点大

  • 适才相戏耳 06-08 23:39
    16

    类似OAI之前的5.3SP模型,

  • jcc 06-08 23:40
    17

    glm-5.1的高速版是无损全精度


    小米这个为了更快,选择了“近乎无损”“部分量化”

  • 啁啾 06-08 23:41
    18

    1000 token/s 的速度快点夸张了


    看了眼本地记录,前些天 deepseek pro 官方 api 大概有 48 token/s,any 大善人的 gpt 5.5 有 37 token/s

  • ZackWill 楼主 06-08 23:41
    19

    codex-spark是cerebras方案的,需要缩小模型参数规模来完整放在片上内存里面,和量化的路线还不太一样

* 帖子来源Linux.do
返回