2 台 DGX Spark 上运行的本地 LLM 横向对比

ldm0 2026-09-04 00:30 1

有三个模型能跑


过去一周 flash 模型集体更新:



  1. Qwen3.8-Flash-Next

  2. GLM-5.3-FLash

  3. DeepSeek-V4-Flash-Vision-Exp(之前没有 Vision)


比较幸运的是这几个模型刚刚好都能在两台 DGX Spark 上面跑起来,直接爽吃。


横向比较


在这三个模型里面来回切换了好多次,说一下使用体验:



  • 速度层面:


Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp > GLM-5.3-FLash



  • 代码质量:


GLM-5.3-FLash > DeepSeek-V4-Flash-Vision-Exp > Qwen3.8-Flash-Next



  • 图形理解:


GLM-5.3-FLash > Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp


比较细节的是 GLM-5.3-FLash 有两个量化版本 EXL3 和 NVFP4:



  1. NVFP4 的 prefill 更快(加载历史会话更快) 1500t/s 左右,比 EXL3 1000t/s 快很多

  2. EXL3 的 decode 更快(吐字更快) 28t/s ,比 NVFP4 20t/s 快很多


主观结论


我主要是用 Hermes ,这三个模型其实都已经非常不错了,没有找到什么明显瑕疵。


总的来说如果要绝对质量,用 GLM-5.3-FLash; 要绝对速度,用 Qwen3.8-Flash-Next


DeepSeek V4 Flash 有点中不溜,而且图像理解似乎有点近视,看不清图片细节,实测被上面两个模型爆杀。


现在每天日常在用 Qwen3.8-Flash-Next :D

最新回复 (27)
  • honjow 09-04 02:42
    1
    羡慕双 DGX
  • ldm0 楼主 09-04 04:25
    2
    @honjow 几个月之前从闲鱼低价收的,现在的价格已经完全买不起了 T.T
  • witcherhope 09-04 08:11
    3
    羡慕大佬,不像我,只能用 4090 48G 版本本地跑一跑 Qwen3.8-27B-FP8
  • zzutmebwd 09-04 08:19
    4
    hhh 看到最后一句果然是这样 其实本地模型就是够用够快,追求绝对智力直接换 opus api
  • 0x400 09-04 08:24
    5
    速度具体是多少呢
  • heyjei 09-04 08:48
    6
    我也部署了一个 QWen3.8 27B ,速度有 30tokens/s

    不过我的问题是 claude code 接这个用的时候,始终无法流畅使用,不是 auto mode 的权限分类器无法成功运行,就是 Web Search 无法运行。

    你是怎么用你自己搭的本地 LLM ,前面有接什么 agentic api 层吗?
  • qazwsxkevin 09-04 08:50
    7
    大佬可以说一下上面提到的 3 个模型的精度吗? 同一个模型精度差一个级别,输出质量有多大区别?
  • sentinelK 09-04 09:00
    8
    @heyjei 相对而言 dsh 这种比较开放的 harness 更方便实现全工具能力。可以靠插件,可以靠 skill 。
    Codex 和 Claude Code 都是依赖 API 来提供 web_search 的,所以一般只能安装第三方 MCP 来实现。

    @qazwsxkevin 抱脸的量化方在文档中都会着重体现自己的量化方案的损失,关键词是 KDL 以及 Top 1%正确率。通常来讲,优秀的 4bit 量化的 top 1%大概在 95%~97%。比如 unsloth 就以量化损失小著称。他们会公布热门产品的量化损失曲线。
  • tsja 09-04 09:10
    9
    小白想知道,像这样本地运行的都是量化版的吧,像 GLM5.3flash 的量化版和官方 API 的满血版性能体验差距有多大呢?
  • RexKang 09-04 09:59
    10
    @ldm0 好奇多低收的……能说个范围吗
  • qa2080639 09-04 11:14
    11
    一台的话推荐什么模型 我部署的 qwen27B 才 25T/s
  • ldm0 楼主 09-04 11:27
    12
    @zzutmebwd 快就是好.jpg
    主要是 Qwen 的智力其实也很高了,只要不写代码。
  • ldm0 楼主 09-04 11:29
    13
    @0x400 qwen 和 deepseek 的 prefill 差不多是 2500t/s 和 1800t/s ,单流 decode 二者差不多都是 70t/s ,多流的话 qwen decode 要更快一些
  • ldm0 楼主 09-04 11:31
    14
    @heyjei 换一个对本地 LLM 支持更好的 harness 吧,比如 pi 。
  • ldm0 楼主 09-04 11:33
    15
    @qazwsxkevin DeepSeek 是 fp8 满血,GLM 是 EXL3 和 nvfp4 ,Qwen 是 nvfp4 。

    这几个量化都不极限,智力基本都保持的比较好,几个模型看评估数据基本都是 95%以上,我体感上没有智商问题。
  • ldm0 楼主 09-04 11:35
    16
    @tsja 没有用过官方 API ,但是 GLM5.3 Flash EXL3/NVFP4 的能力其实已经远远超出我的预期了,聪明是真的聪明,和其它两个有代差的感觉。
  • ldm0 楼主 09-04 11:35
    17
    @RexKang 5w4 收的两台+连接线
  • ldm0 楼主 09-04 11:37
    18
    @qa2080639 一台可以用 Ling Flash 之类的模型,DeepSeek V4 Flash 也有一个单 DGX Spark 可跑单量化版本。

    可以去 nvidia 论坛看看,不少人都只有一台 https://forums.developer.nvidia.com/c/accelerated-computing/dgx-spark-gb10/719
  • yachen 09-04 12:55
    19
    双 dgx prefill 和 decode 实测多少速度?
  • ldm0 楼主 09-04 13:44
    20
    @yachen 上面有说,不同模型差别挺大的。
  • xqk111 09-04 13:54
    21
    这个部署的话,能几个人同时用吗
  • minibear2021 09-04 13:58
    22
    @ldm0 #17 性价比出来了
  • ldm0 楼主 09-04 14:09
    23
    @xqk111 glm 5.3 不行,没有足够 kv cache ,deepseek 还有 qwen 可以。
  • ldm0 楼主 09-04 14:10
    24
    @minibear2021 如果硬件正常贬值的话没什么性价比,但是现在还能小赚一点的话性价比就爆了。
  • flyico 09-04 15:57
    25
    无论什么时候,都是线上 plan 比本地划算啊,有这几个 w 够你买多少年的 plan ,而且永远是满血+最强+最新版,本地部署唯一的优点就是数据安全可控,对于合规要求高的只能有本地部署了
  • TArysiyehua 09-04 16:03
    26
    @flyico 也不能这么说,现在硬件出来没多久就涨价,买这个比买 A 股还香,自己 5 万买的玩了一年 10 万卖出去。
  • ldm0 楼主 09-04 17:07
    27
    @flyico 可以全都要,比如现在线上 plan 会拒绝干一些逆向的活,然后一些敏感问题也可以问,全在本地就很安心。
* 帖子来源V2EX
返回