mac m5 ultra 上线中国官网。1.2T 显存带宽, 256GB 版本 8.6 万

sentinelK 2026-08-26 09:46 1

编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
信源会罗列在文章下方

结合 256GB 统一内存来看,目前比较有价值的就是运行 ds-v4-flash-0731 ,恰巧最近 omlx 有过一次版本更新,官方性能数据如下:信息来源
f917c000-707f-43a1-b0a1-23bd464ed4e9-image.jpeg


然后,M5 Ultra 的内存带宽是 M3 Ultra 的接近 1.5 倍。又根据苹果官网数据,其 prefill 性能是 M3 Ultra 的 4 倍( ollama 数据,框架不同,只能参考)


所以大概预期,M5 Ultra 运行 ds-v4-flash-0731 Q4 的大致性能是:


prefill




































上下文 M3U ( v0.5.4rc2 )
1K 531.0 ~1590 ~2120
4K 486.5 ~1460 ~1950
64K 468.5 ~1410 ~1870
128K 438.6 ~1320 ~1750

decode































场景 M3 Ultra M5 Ultra 预计
MTP 关,1K 27.6 ~40
MTP 关,4K 25.8 ~38
MTP 关,64K 22.8 ~33
MTP 关,128K 21.3 ~31

信息来源:
https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2


https://www.apple.com.cn/mac-studio/


https://omlx.ai/compare

最新回复 (29)
  • sentinelK 楼主 08-26 09:49
    1
    也就是说,结合实际场景,大概实际应用时打开 MTP ,prefill 也就是 1500 左右的水平,decode 大概在 60 左右。

    prefill 性能仍然偏低。

    但是结合非常大的统一内存,能实现非常高的多会话缓存命中能力,所以和多卡部署相比,有利有弊。
  • FrankAdler 08-26 10:11
    2
    NVIDIA 打下的江山,Apple 开始摘桃子了吗
  • ReinXD 08-26 10:16
    3
    这个价格对比 n 卡服务器,甚至可以说性价比爆表,统一内存的架构优势在 LLM 时代凸显出来了
  • xiaoyi123 08-26 10:29
    4
    虽然比不上 nvidia ,但是便宜啊!!!!!
  • octocatami 08-26 10:30
    5
    快囤 mac mini
  • ila 08-26 10:58
    6
    可以使用 DeepSeek V4 Flash Vision Exp 吗
  • Cruzz 08-26 11:00
    7
    逼的哪天老黄给显卡加内存条。让你们胡搞
  • scegg 08-26 11:01
    8
    这速度适合一个人玩玩。甚至不适合一个人干活(并发 agent 的情况)。
  • Nzelites 08-26 11:25
    9
    dsf 什么时候个人部署可以比较简单的到 100tps 的话感觉比较可用
  • sillydaddy 08-26 11:26
    10
    是不是比双 DGX Spark 要强?
  • sentinelK 楼主 08-26 11:30
    11
    @sillydaddy 从推论来讲,是。但是这个需要看实测。
    毕竟 GB10 跑的是 cuda ,mlx 环境不能直接横比。
  • clemente 08-26 13:03
    12
    @ReinXD 同配置 nv spark 只要 3w 啊
  • OnEvent 08-26 14:27
    13
    这玩意是不是还能多机并联增加性能来着
  • ReinXD 08-26 15:29
    14
    @clemente dgx spark 显存没有 512g ,这个区别挺大的,跨越到 512g 意味着可以部署满血 1M 版本的 dpsk v4f ,而且 m5 ultra 带宽 1.2TB/s 也是吊打 dgx ,大模型计算核心耗时其实都是权重搬运,这个对实际使用提升应该是非常巨大的。总的来说,和 dgx 完全不是同级别的硬件,dgx spark 还是有点不上不下,m5 ultra 已经摸到云端服务器水平了,考虑到个人/小团队使用甚至非常超模,部署的好很有可能比用官方 api 的体验还舒服
  • flyico 08-26 15:38
    15
    Q4 量化版,和满血版能相差多大?
  • dragonszy 08-26 15:49
    16
    是不是得等 512gb 的版本
  • mkdirmushroom 08-26 16:00
    17
    目前准备搞个 256 的,up 建议等 512 吗?个人感觉模型参数量大的话,受制于内存带宽,性能不会好到哪里去,所以感觉 512 的意义不是很大,相较于 256 的话。
  • ReinXD 08-26 16:11
    18
    @mkdirmushroom 真要买得等 512g ,能满血部署 1M dpsk v4f 是质变,不然不如买块 5090 玩,1.2T/s 对 1-4 个人来说其实是很超模的带宽水平,你对比 H200 那种 4.5T/s ,这么点人数根本吃不满带宽,楼主的估计其实还保守了点,低负载下+dspark mtp 加速,我算了下理论上至少能到 100 token/s
  • unifier 08-26 16:15
    19
    @dragonszy 跑 dsv4f 应该用不到 512 的,glm 的量化版本应该至少要 512 了
  • sentinelK 楼主 08-26 16:15
    20
    @dragonszy @mkdirmushroom 如果只是聚焦于 0731 的话,个人谨慎预测,性价比很低。
    v4-flash 无损就是 8bit ,所以其实 256GB 已经可以跑无损(和 GB10 * 2 逻辑一样),但是 prefill 和 decode 会更难看。

    而且家用不太可能同时占用太多个 session 的 kvcache 。同时保持 3~5 个 session 是在线的我已经觉得大脑过载了。

    512GB 的优势一个是能同时保持更多的 1M 上下文的 session 在线(能命中缓存)以外,就是能跑更大规模的模型。
    但是反过来说,更大规模的模型 prefill 和 decode 会更慢。

    所以,统一内存方案的掣肘就在这,看似能跑很大的模型,但是实际把 RAM 占满速度又无法接受。
  • aimuz 08-26 16:17
    21
    256G 的要 14 万,512G 应该不会少于 20 万吧?
  • tanszhe 08-26 16:26
    22
    话说最近小米发布的 o100 也是 1.2T 带宽 是不是类似?
  • sentinelK 楼主 08-26 16:29
    23
    @tanszhe 这个完全没有基础数据,所以只能看看了。毕竟内存带宽只是一个必要条件,并不是充分条件。
    LLM 的表现和硬件、生态、框架、甚至模型本身都息息相关。

    就像是保时捷 911 卡雷拉的前悬挂用的依然是麦弗逊结构。但你不能说用多连杆的面包车比他更运动。
  • slowgen 08-26 16:39
    24
    今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

    人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
  • sosme 08-26 17:02
    25
    @tanszhe 小米那个应该和老黄那个 nv spark 差不多,统一内存撑死 128g
  • kenvix 08-26 20:55
    26
    @FrankAdler #2 好事,总得有人给牢黄上点强度
  • Gomoku2024 08-26 21:18
    27
    其实更强的是可以多台 Studio 组合,实现 TB 级别的超大显存。
  • wy315700 08-26 21:22
    28
    所以 4080S 32G 魔改版来了,8 卡刚好 256G 显存。
    巧不巧,惊喜不惊喜,意外不意外。
  • iugo 08-26 21:57
    29
    将来可能会有架构变动,比如 Cerebras 在 decode 场景性能很强,将来会有优化,但我觉得这个变动很可能不来自 NV 。
* 帖子来源V2EX
返回