两台 dgx-spark 部署满血 deepseek v4 flash 完全指南,稳定 60~70tok/s 单流

dbow 2026-08-07 12:44 1

前天看 x 上有人做成这事, 觉得很不错, 下单买了两台, 6 万 8, nvidia 原厂 dgx spark 带并连线
实测两台刚好能拿捏 deepseek v4 flash 0731 ,vibe coding 单流 60–70 tok/s 的体验足以覆盖日常 ;不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。
主要是为了本地化隐私部署, 经常会跟 ai 聊很多机密信息, 不放心, 靠硬件出 token 得好几年才能回本.
欢迎交流
github: https://github.com/maliubiao/dgx-spark-2-deepseek-flash-0731
最新回复 (43)
  • yoshiyuki 08-07 13:34
    1
    但是你的 agent 说到底是联网的, 信息潜在的泄漏点太多了
  • Lazymio 08-07 13:46
    2
    6 万 8 是京东自营的?感觉买贵了。
  • SayHelloHi 08-07 14:41
    3
    @dbow

    老铁咨询下,DXG 使用 comfyui 体验如何?

    也想入手
  • wyntalgeer 08-07 14:43
    4
    感谢,已 star
  • dbow 楼主 08-07 14:54
    5
    @SayHelloHi 跑一个 deepseek v4 flash 90%计算资源就用光了, 暂时还没试过别的东西.
  • Insolitude 08-07 15:01
    6
    可以帮忙用 llama-benchy ( https://github.com/eugr/llama-benchy )测一下吗?之前用两台 spark 测过预览版的 deepseekv4 flash ,当时跑起来还蛮吃力的,想看看现在性能怎么样


    """
    | model | test | t/s (total) | t/s (req) | peak t/s | peak t/s (req) | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
    |:------------------------------|------------:|----------------:|----------------:|-------------:|-----------------:|------------------:|------------------:|------------------:|
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c1) | 955.27 ± 193.11 | 955.27 ± 193.11 | | | 2257.64 ± 530.54 | 2251.15 ± 530.54 | 2257.64 ± 530.54 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c1) | 38.67 ± 1.58 | 38.67 ± 1.58 | 39.93 ± 1.63 | 39.93 ± 1.63 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c2) | 919.38 ± 159.59 | 586.78 ± 244.14 | | | 3948.41 ± 1160.98 | 3941.91 ± 1160.98 | 3948.41 ± 1160.98 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c2) | 39.08 ± 20.50 | 25.04 ± 9.26 | 58.67 ± 3.09 | 29.79 ± 3.35 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c4) | 924.07 ± 122.40 | 358.73 ± 142.02 | | | 6692.54 ± 2550.41 | 6686.05 ± 2550.41 | 6692.54 ± 2550.41 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c4) | 18.68 ± 2.40 | 10.41 ± 5.84 | 71.33 ± 4.03 | 19.42 ± 1.32 | | | |

    llama-benchy (0.3.7)
    date: 2026-05-18 16:43:49 | latency mode: api
    """
  • mouyase 08-07 15:04
    7
    《不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。》

    您也 AI 化了。
  • dbow 楼主 08-07 15:13
    8
    @mouyase ai 写的文档, 我复制了一句过来, 哈哈
  • Nasdaq 08-07 15:17
    9
    请教老哥,功耗/发热怎么样?我也想搞 2 台玩玩。
  • defunct9 08-07 15:23
    10
    新模型发布这么快,花 6 万 8 ,合适么?
  • Tink 08-07 15:24
    11
    好像还不错啊
  • ferch 08-07 15:26
    12
    这很好呀,能自己本地玩了
  • dbow 楼主 08-07 15:29
    13
    @Nasdaq agent 跑起来 gpu 70 度左右
  • asdjgfr 08-07 15:30
    14
    省着点用,10 年之后我要捡垃圾自己部署一个😆
  • Nasdaq 08-07 15:31
    15
    @dbow #12 继续请教您,部署起来困难吗?还是说能让 cc/cx 直接托管一键部署?
  • lizhenda 08-07 15:39
    16
    等新模型发布了,硬件不够用了怎么办?
  • ysz1121 08-07 15:39
    17
    6.8w 充 deepseek 官方,是不是能用一年?
  • shyrock2026 08-07 15:48
    18
    op 这个速度是开的 200k 上下文还是 1m 呢?
  • dbow 楼主 08-07 15:58
    19
    @Nasdaq 全交给 ai
  • dbow 楼主 08-07 15:58
    20
    @shyrock2026 1M
  • Newb1e 08-07 16:03
    21
    心动
  • faker5276 08-07 16:08
    22
    deepseek 涨价以后,这方案就有性价比了
  • op351 08-07 16:12
    23
    @ysz1121 按现在 ds 的 api 定价,一天 24 小时不停的用,保守点能用 10 年
    不过现阶段算力本地部署基本不是为了省钱,而是为了合规和数据隐私
  • dbow 楼主 08-07 16:21
    24
    @op351 大概三年能回本, 目前一个月 1k 的 v4 flash api 费用,假定涨价后价格翻倍, 则一年需要 2.4w 的 token 费用, 算上电费之后三年回本.
  • yanhuqing666 08-07 16:39
    25
    有点意思
  • AEDaydreamer 08-07 17:02
    26
    没钱没需求, 但是看完有很心动的感觉.
  • lhtdeg 08-07 17:14
    27
    速度这么快?那我也要搞一个了
  • Lighfer 08-07 17:21
    28
    老哥,有试过能支撑多少并发和速度不?
  • Lighfer 08-07 17:23
    29
    @Lighfer 看到了链接里有
  • ziyeziye 08-07 17:35
    30
    看看 B 站有搭配教程
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows 下支持 agent ,龙虾,5999 元可跑原版非量化,无需 linux 操作
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows
  • Nasdaq 08-07 17:38
    31
    @ziyeziye 我是 4090 ,部署过 qwen3.6-27B ,速度可以。但是蠢哭了~
  • ziyeziye 08-07 17:38
    32
    @ziyeziye 都是满血版的
  • seers 08-07 17:55
    33
    模型也在进化,相同硬件也可以免费获取性能升级
  • wsbqdyhm 08-07 18:26
    34
    @Nasdaq #31 20-30 的速度,经常任务中断
  • Nasdaq 08-07 18:29
    35
    @wsbqdyhm 那还没有深入测,跑了个 30 分钟感觉不行就丢了。
  • Yserver 08-07 18:34
    36
    感觉有点慢 ds 新的那个加速是不是没生效啊?
  • dbow 楼主 08-07 20:06
    37
    @Yserver 已经开启了 dspark 才有 60~70tok/s
  • sillydaddy 08-07 21:53
    38
    这么估算回本时间呢:
    1. Deepseek ,1 次调用平均输出 420 token ,按官方 API 计价花费¥0.004 元。那么¥68000 元可以纯输出 7,140,000,000 个 token 。

    2. 现在驱使 DGX-Spark ,每秒输出 60 token 。

    回本需要 3.7 年=7,140,000,000÷60÷3,600÷24÷365 。(电费是零头)
  • dbow 楼主 08-07 21:58
    39
    @sillydaddy 这只算了输出, 实际并发能做到 200tok/s, 输入能做到 1000 tok/s,输入也是收费的
  • fanhed 08-08 03:32
    40
    @yoshiyuki agent 是否联网是可控的
  • fanhed 08-08 03:35
    41
    @sillydaddy 还要算 prefill, 还要算 prefill 的 cache 命中
  • bigdogbigpig 08-08 11:32
    42
    如果满血 ds v4 flash 可以用两台 dgx spark 部署,那还有别的模型可以部署吗?
  • yoshiyuki 08-08 12:24
    43
    @fanhed 现实中真正投入使用的 agent, 联网的多, 不联网的少
* 帖子来源V2EX
返回