小米/xiaomi AI Cube 推理性能估算

凌风神舞 2026-08-24 23:00 1




今天小米发了三颗芯片, 把这三颗芯片塞到一个机子的AI Cube, 就非常感兴趣.


我根据今天放出的消息, 尝试推算了如果拿这台AIPC去推 Qwen 3.8 27B会是什么表现.


我们假设这台机子, 塞了一块128g的统一内存, 然后96g可以用于动态分配.


已知:



  1. 带宽是1.22TB/s, 终于来了一个肯给带宽的机子了, dgx spark的273GB/s是什么渣渣.

  2. 端侧推理速度是330 Tokens/s, 结合第二张图, 可知, 这个速度是在3B模型下跑出来的, 这个模型是一个5值模型, 这个算下来, 只吃了30%~40%的带宽, 感觉是为了给多模态, 语音, 上下文, 留足了带宽空间.


我们采用Qwen 3.8 27B Q8_0版本, 模型文件大小是28.6GB, 为了方便计算, 我们直接按照30GB算


上下文我们直接给拉满到1M, 这部分KV Cache 开销是64GB.


假设1.22TB/s的带宽, 我们只用到8成, 推理速度也可以轻松达到30+ tokens/s, 如果遇上雷霆思考, 还是会有点慢(几千tokens的思维链可能耗时就是10多分钟, 相比40分钟已经是巨大进步)


如果嫌这个慢了, 那么还有Q4_K_M, 做到50tokens/s, 应该也不是难事, 思考时间大幅缩短.


以上都是我的推测, 如果计算有误, 欢迎各位佬指出.


最可惜的是赶上这波硬件大涨价, 想必这台机子也不会便宜.

最新回复 (7)
  • 天则则 08-24 23:01
    1

    330token 是那台手机跑的,不是 d100 这个算力芯片

  • 凌风神舞 楼主 08-24 23:02
    2

    佬, 可以看我第二张图片, O100芯片的亮点都标注了, 右上角就是推理速度展示.




    佬说的很对, 330 tokens/s这个是手机上的推理速度, 也就是端侧推理速度.

  • 天则则 08-24 23:05
    3

    我发现挺多人都看错了这个^-^

    因为 3b 这款蒸馏模型在两个设备的介绍中都出现了。

    前者是介绍通过 O100 这个加速芯片,能够在手机上让它跑到 330token

    后者是介绍在这台算力单元上,自带的模型可以配置快慢模型,120B 和 3B。

  • 天则则 08-24 23:06
    4

    对的,就是介绍这款芯片在手机上的表现。

  • 凌风神舞 楼主 08-24 23:07
    5

    因为我算了下, 在1.22TB/s的带宽下, 330tokens/s显然是没吃满带宽的, 或者说偏小的, 在这个AI Cube上, 3B模型应该会有更快的速度, 应该不止330才对.

  • XZiar 08-25 02:02
    6

    没有设备能真吃满带宽吧……cpu上跑个mlc也就只有理论值的80%的

  • 菜鸡rrr 08-25 02:09
    7

    这个O3不是手机芯片吗,推理时候需要这个芯片起到啥作用呢,只是推理3B模型的话加一点显存就能一起跑了吧

* 帖子来源Linux.do
返回