请教一下,本地部署 deepseekV4flash 大概需要什么样的配置需求?

yiranw09 2026-08-06 11:07 1

先说明背景,我们公司是半导体公司,我是生产的工程师,并不是信息部门的,但是生产这边有需求,做自己的数据分析跟踪平台,信息部那边又没人力,我们一个实验管理平台拖了半年了还没给我们做好,我拿 llm 自己都 vibe 了一个。
现在有两个需求都需要用到 ai ,而且因为数据敏感,还必须是纯本地运行。
一方面试生产工程师开发自己的数据平台需要 ai 做 vibecoding ,另一方面我们希望能用 ai 做数据分析和建模,这方面我们已经悄悄地通过 ai 输出验证了很多东西了
之前是国产开源的模型能力一般,能力好的模型又太大,部署成本太高,但是近期 deepseekV4flash 的模型量较小,部署成本大幅度降低,能力也完全胜任我们的需求,前段时间的 dflash 技术也让速度能够显著上升。
想问问有没有本地部署 deepseekV4flash 的方案,我可以借鉴一下
然后下周拉着我们生产领导去找信息部领导 Battle
最新回复 (80)
  • duanxianze 08-06 11:09
    1
    你为啥不直接问问 deepseek 呢
  • duanxianze 08-06 11:11
    2
    不过我可以提前提醒你一句,目前有钱你都不一定能搞定,到处都在缺货
  • OutOfMemery 08-06 11:15
    3
    有专门做内网部署的商家,包括硬件,某宝,视频平台可以找找了解一下
  • Kinnice 08-06 11:17
    4
    Mac Studio
    - M3 Ultra
    - 256GB 统一内存 推荐 512GB
    - 2TB SSD
  • 106npo 08-06 11:18
    5
    https://apxml.com/zh/tools/vram-calculator
    可以拿这个算
  • yiranw09 楼主 08-06 11:22
    6
    @duanxianze #1 问了啊,它给了好几个配置,有 mac studio 128/256 ,有 H100/A100*2 ,有 ada6000*4 ,但是我也不清楚具体效果如何,想问问实际方案和效果,有没有更适合生产的解
  • yiranw09 楼主 08-06 11:22
    7
    @duanxianze #2 我也在想这个问题...
  • yiranw09 楼主 08-06 11:23
    8
    @OutOfMemery 这要是还找商家我们信息部是真的不用干了 全外包得了
  • vandort 08-06 11:24
    9
    自己运行一个 DeepSeek V4 Flash 级别的大模型大概需要 200G 左右的显存,最便宜的方案是 4 个 48G 的 4090 。我不是很确定 4090 跑 DeepSeek V4 Flash 会不会有数据格式上的问题,但如果有问题的话可以选择 DeepSeek V4 Flash W4A*的版本,精度损失比较小,基本是可用的。问题是 48G 的 4090 目前市场上比较少,不一定能找到。如果没货,替代方案是一台 8 卡 5090 的机器。这两种方案都要花大概 30-50 万。还可以买二手的 910B4 ,应该不会超过 70 万。这些是 5 月底的价格,不知道最近涨价没有。我们的业务里包括了给客户提供各种形式的正规的大模型服务的,有需要可以找我们。
  • uiosun 08-06 11:25
    10
    @vandort 涨了的,六月底咨询工作站,两家还不错的公司,问销售都说涨价了
  • yiranw09 楼主 08-06 11:26
    11
    @Kinnice 嘿,现在 Mac studio 涨价也太厉害了,而且 token 输出还是感觉有些慢,加上 mac 不支持 vllm ,而 deepseekv4flash 似乎还没有 MLX 模型吧
  • yiranw09 楼主 08-06 11:27
    12
    @106npo 打不开欸,不知道为什么
  • 106npo 08-06 11:31
    13
    @yiranw09 应该不用翻墙.不过这样的网站挺多的 ,找个支持计算预期 tps 和 ttft 的网站看吧
  • evil0harry 08-06 11:32
    14
    我看有人推荐两台 NVIDIA DGX ,单台 35k 左右
  • mzsongyan 08-06 11:34
    15
    看看 dgx spark
  • levn 08-06 11:41
    16
    PRO 6000 x 2
  • AAAAAAAAAAAAAAAA 08-06 11:44
    17
    个人用和公司很多人用是不一样的,吐字速度跟不上,找个专业的评估一下吧。
  • yiranw09 楼主 08-06 11:49
    18
    @AAAAAAAAAAAAAAAA 所以不是来 V 站问问现成的方案嘛,先有个大概我好去 battle (
  • Chihaya0824 08-06 11:49
    19
    别买 mac, PP 拉完了,同理由不推荐 dgx spark/AI max 395 ,除非是愿意等那其实 ok ( 395 问题更大,fp8 都不支持)
    正经用就是最低 2 个 pro 6000 或者 4 个多人大 context
    如果电够多也可以选择 8 个 5090 的方案也行

    @vandort 靠谱,sm80 系列其实就是会有不支持 fp4 的问题,就是没办法跑原版(
  • yiranw09 楼主 08-06 11:49
    20
    @evil0harry 似乎可以欸
  • yiranw09 楼主 08-06 11:51
    21
    @Chihaya0824 带宽还是太低了是吗?哎,不知道能不能买得到
  • Chihaya0824 08-06 11:51
    22
    还有别买 pro 6000D ,一买一个不吱声
  • Hilalum 08-06 11:51
    23
    https://omlx.ai/compare 这输入模型和芯片可以查到真实部署的 tok/s
  • Chihaya0824 08-06 11:52
    24
    @yiranw09 不是,Mac 带宽可以的,我说的是 prompt processing 慢,就是你给他大量长文本的时候你要等很久才会开始吐字,以及并发使用的时候会很慢
  • yiranw09 楼主 08-06 11:53
    25
    @Chihaya0824 #24 嗷我好像知道咋回事,M3 那会还没有加速单元,M5 才加上的
  • Vveeb 08-06 11:56
    26
    > 而且因为数据敏感,还必须是纯本地运行
    我说个题外话, 大清都亡了, 现在中小公司真的有那种很敏感的数据么?
    人家顶尖的 Cyber 模型都已经能发现茫茫多的网络安全漏洞了 (至少人家模型厂商是这么吹的).
    真让人家模型厂商拿到公司的数据了, 这数据对模型厂商有价值么?
  • Chihaya0824 08-06 11:57
    27
    @yiranw09 是,没有 matmul 加速导致的,但是 m5 也并没有解决什么问题,目前只支持 fp16/bf16/int8 的加速,不恰当的例子你可以理解为他停留在 sm80(A100)时代
  • AEDaydreamer 08-06 12:03
    28
    @Vveeb 道理懂技术的人都懂, 更多是制度和合规吧.
  • foryou2023 08-06 12:16
    29
    你搜索一下 b 站,我刷到过别人的部署个人使用,个人使用的话,好像 10 万就够了,每秒 Token 在 100 左右好像,不过这个金额记得不是很清楚。
  • yiranw09 楼主 08-06 12:17
    30
    @vandort 看了一下,感觉现在这个价格要更贵了...
  • yiranw09 楼主 08-06 12:20
    31
    @Vveeb 哎...问题是我们的数据不是那种 ai 会需要的数据,而是在生产行业中很敏感的数据,虽然 ai 不需要,但是会有数据泄露,这个很严重。
  • wwhc 08-06 12:22
    32
    两块 RTX PRO 6000 ,配置 llama.cpp 用于提供推理服务,满血 v4 flash 也就 160GB 左右。就算是单 RTX 5090 ,也够个人用,输出也可以达到 10-20t/s
  • jimrok 08-06 12:26
    33
    建议你用生产的样本数据给 ai ,写出分析程序之后,去跑生产数据。这样敏感信息的处理还是自己控制,但分析工具让 ai 给你造。
  • GeTLeFt 08-06 12:33
    34
    @Vveeb 很多啊,比如金融法律这种涉及用户隐私的
  • yiranw09 楼主 08-06 12:36
    35
    @jimrok 问题在于样本数据我都很难发给 ai ,以及生产的数据很复杂,变量影响因素特别多,不给真实数据分析程序是写不明白的,除非我提示词工程能写的特别清晰...但是这个实在是太难了,我们之前偷摸摸用的时候就是这样做的,工程量巨大不说,调试测试也很麻烦,甚至数据还清洗不干净,可是几十万条数据你让我手动清理...哎
  • suke119 08-06 13:13
    36
    @yiranw09 要么 A100 H100 4 张起步 要么昇腾国产系列 8 张起步 优化完速度 30-40 左右 效果还可以 目前我们实践过的 vllm
  • lrabbit 08-06 13:14
    37
    我前天刚部署了一个,两台 dgx spark,昨天连续跑了一个 7w 多行的 rust 代码,跑了十几亿 token ,总体感觉速度比官方 api 慢 30%,本地大概 50token/s,官方 70-100 token/s 目前 dgx spark 是我觉得最适合部署 deepseek v4 flash 的设备,放在桌面上简直是个艺术品,一点声音也没有,等我多跑几天,后续发个测评
  • KOMA1NIUJUNSHENG 08-06 13:20
    38
    @yiranw09 #8 你可以跟老板报告你拿着 AI 能把信息部的活全揽了,让他把信息部全开了给你涨工资,过两年直接财富自由
  • jimrok 08-06 13:27
    39
    @yiranw09 确实,你这样的需求非常多,dgx spark 这样的产品未来会是一个主要的形态。苹果,国内的瑞芯微应该都会类似的产品出来。每个办公室都需要一个这样的数字员工,看看打印机的规模,这个市场真是太大了。
  • sparkssssssss 08-06 13:41
    40
    实测,我们有一台 m3 256G/1T 的版本,ds 刚出圈的时候,买来想着内部跑着试试的,结果,实测,跑个 70b 都勉强,能跑,但是速度很慢,正常用,30b 左右的模型,使用问题不大,但是并发也不行
    我以为用的框架有问题,ollma/vllm/lmstudi 都测试了下,来去不大,不推荐 mac ,能跑,但是仅仅是能跑,
  • sky009 08-06 13:48
    41
    @lrabbit 大佬部署的哪个模型?我看有专门的 DeepSeek-V4-Flash-DSpark 的模型,是否部署的这个版本。
  • qishua 08-06 13:53
    42
    @vandort 哪来的 48G 型号的 4090 ?,我们之前部署用的是 8 卡的 4090 24G 的,部署的是 ds r1
  • kakakakaka8889 08-06 13:56
    43
    现在昇腾的卡都不好买到
  • Jesens 08-06 13:59
    44
    一般来讲 vllm 官网的应该是最准确的: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Flash
  • TomatoCLI 08-06 14:29
    45
    当生产力的话你就 36 楼说的,当玩具的话你就按上面说的 Mac 部署。
  • hafuhafu 08-06 14:50
    46
    首先排除 DGX Spark 这类东西,因为只适合简单实验性探索,没法当生产力。
    要生产力正儿八经弄点显卡跑,看你预算了。正经想要速度和并发,投资不小。
    我 DGX Spark 单台跑了个 Qwen3.6-35B-A3B-FP8 的模型,30-50 的 tok/s 吧。
    跑 Qwen3-VL-8B-Instruct ,10-20 。效果倒是还可以,但是龟速。等完整输出完都猴年马月了。
    下了个量化过的 DeepSeek v4 flash 还没测,看测评也是 10-20 左右。
  • flyico 08-06 14:57
    47
    至少需要 70w ,不要盯着最低需求看,能吐字和能流畅的吐字完全是两种产品。
  • jlkm2010 08-06 15:01
    48
    2 张昇腾 950PR 起步,最好是 4 张,如果对吞吐量要求比较高,可以搞一个 8 卡昇腾 950PR 服务器
  • yiranw09 楼主 08-06 15:10
    49
    @suke119 是增加 dflash 之后吗?并发效果如何?
  • yiranw09 楼主 08-06 15:11
    50
    @flyico 70w 大概率是超我们部门的预算了(
    提到集团公司上说不定有戏,这傻逼公司是真的抠门
  • Haku 08-06 15:17
    51
    按百万算。
    不止你买硬件,后面跑起来电费,散热,维护也是一大笔开销。
  • yiranw09 楼主 08-06 15:17
    52
    @Jesens 上面的要求也太高了...哈,8 张 H100 ,我从哪偷啊
  • dododada 08-06 15:19
    53
    @Vveeb 理论内容如果是开放的,那值钱的除了商业机密,就是技术实施流程中的各种验证数据和验证方案了,这东西对生产制造行业来讲,就是命脉
  • dododada 08-06 15:20
    54
    好像 V 站的朋友很少和供应商打交道,渠道商肯定是缺货的,但是制造商不一定缺货啊
  • yiranw09 楼主 08-06 15:25
    55
    @dododada #54 到时候再拉上神通广大的商务,hhhh
  • han1988 08-06 15:37
    56
    最便宜是搞 4 张 cmp 170hx ,解锁到 40G 的就行。
  • north521 08-06 15:43
    57
    两个 dgx spark 就行了,我这部署了,没问题,60 多 token/s
  • bunai 08-06 16:03
    58
    @north521 烫的起飞吧
  • ZZFM 08-06 16:33
    59
    用 MI300 或者 MI325 ,生产级别的硬件和代码,速度还够快,可以看看这个 https://github.com/ryanzhou/deepseek-v4-flash-mi300x
  • cat9life 08-06 16:35
    60
    @north521 #57 两台总共 256G 显存不够的吧
  • lrabbit 08-06 16:50
    61
    @sky009 https://github.com/eugr/spark-vllm-docker/tree/main 吗,这个版本不会出现问题,跟官方的智商一模一样,我测试过了,其他版本可能会有点问题
  • north521 08-06 16:50
    62
    @bunai #58 推理的时候七八十度
  • north521 08-06 16:50
    63
    @cat9life #60 占了大概 220G
  • beefhotpot 08-06 17:19
    64
    双卡 RTX 6000 Pro, https://github.com/jasl/vllm/tree/codex/ds4-sm120-min-enable
  • beefhotpot 08-06 17:20
    65
    #64, 八卡 5090 也能勉强跑,但是超级慢
  • beefhotpot 08-06 17:21
    66
    https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash/discussions/28 这里有别人构建好的镜像
  • bunai 08-06 17:42
    67
    @north521 #63
    https://tps.bunai.cc/?gpus=dgx_spark%3A2&ic=nvlink4&model=deepseek_v4_flash&quant=int2&ctx=16384&pl=1024&ol=1024&fw=tgi&pcie=gen3 - -我表示怀疑
  • syh2 08-06 18:08
    68
    这种 284B 量级的模型,自己买设备,如果只走内存不走显存,貌似输出 token 特别慢,可能不一定能达到好用的要求
  • superkkk 08-06 20:48
    69
    8 卡或者 4 卡的 5090 能跑 fp8 或者 nvfp4 的,或者用 2 卡 pro6000
  • niubee1 08-06 22:43
    70
    自己爽跑的话,两台 DGX Spark ,要便宜可以去买微星或者技嘉的版本, 技嘉 1T 存储的版本 双机并联差不多 6 万多的成本
  • zsj1029 08-06 22:45
    71
    h20 196g 足够,141 也能跑,一到两块就行 pcie 的卡,改个水冷就行
  • niubee1 08-06 22:49
    72
    @zsj1029 H20 只有 96G 没有 196G , 你怎么看瓢了的
  • beginor 08-07 07:08
    73
    2 张 H20(140G 版本)就可以,不过一定要有 nvlink ,我们用 4 张 H20 了,512k 上下文 10 并发,简直不要太爽
  • Gnnbb 08-07 08:32
    74
    @Chihaya0824 #22
    为什么大佬,我们公司也是准备配 4 块 pro 6000D
    pro6000 好像是受管制
  • Chihaya0824 08-07 08:55
    75
    @Gnnbb BF16 over TF32 accumulation 怀疑是有 5090 一样的游戏显卡的非解锁算力,总之就是很慢
    pro 卡一般是和同 die 的游戏显卡少 2 倍的 tensor core 性能的
  • Chihaya0824 08-07 08:58
    76
    @Chihaya0824 游戏显卡少 2 倍的 tensor core 性能的 “游戏显卡的 2 倍的 tensor core 性能的” 打错了不好意思
  • vandort 08-07 09:22
    77
    @qishua 华强北魔改的
  • anyinuo0413 08-07 09:54
    78
    我们现在单 4090 48g 跑 qwen 3.6 量化版本…写个小工具行,稍微复杂点的得转半天…
    买了俩 48 俩 24…四张都用上也跑不了什么模型…现在跑了俩量化…一个排序一个向量… 空了一块 24 在吃灰
  • clemente 08-07 10:52
    79
    单张 B100 (192GB VRAM) 可以跑 NVFP4 版本的 deepseek-ai/DeepSeek-V4-Flash-0731
  • clemente 08-07 10:52
    80
    @vandort 别买电子垃圾 还不如 rtx6000 呢
* 帖子来源V2EX
返回