公司本地部署开源模型

majuzhang 2026-08-14 09:05 1

想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程

最新回复 (46)
  • owen800q 08-14 09:11
    1
    5090
  • majuzhang 楼主 08-14 09:14
    2
    @owen800q 一张就够了吗,并发会不会很吃力
  • owen800q 08-14 09:15
    3
    @majuzhang 4 張
  • Muze 08-14 09:43
    4
    可以搜 技术犬,他们好像专门弄这个静音 AI 机箱,但是价格动不动就 50 到 80 万的,看预算吧,有机房的话,可以去找各大服务器厂家询价,例如惠普,戴尔之类的
  • someonesnone 08-14 09:44
    5
    感觉得魔改大显存
  • gpt5 08-14 09:54
    6
    看抖音上有人用 5000 块钱 diy 的丐版硬件部署 dsv4flash ,可以跑到 100tps 以上。
  • Integ 08-14 10:01
    7
    4 张 RTX pro 6000 就够了。
  • wu67 08-14 10:03
    8
    除非数据有超常规格的保密要求, 不然还不如买套餐...本地跑单是商用电费就够你们喝一壶了
  • malusama 08-14 10:03
    9
    感觉现在本地部署根本不划算。。
  • majuzhang 楼主 08-14 10:19
    10
    @wu67 主要是财务会用,有保密要求,我也在考虑是本地部署的成本问题
  • woscaizi 08-14 10:20
    11
    现在 Agent 工具的上下文很大的,会导致 prefill 阶段很耗时。如果是 20-40 人使用绝对不是 4 张 5090 ,6000 就能搞定的
  • majuzhang 楼主 08-14 10:25
    12
    @woscaizi 其实就是说,本地部署的方案成本会很高而且不好用是么
  • ttwxdly 08-14 10:39
    13
    少说 10 张 5090 。还有内存啥的,一点都不划算。
  • hrapunzel 08-14 10:42
    14
    deepseek-v4-flash 高精度量化模型,两个 dgx spark 可以跑
  • woscaizi 08-14 10:43
    15
    部署 deepseek 、glm 、mimimax 之类效果好的开源模型用起来会很好,但不是低成本就能部署下来的。你可以调研下部署 deepseek-v4-flash 需要多少钱,它的部署需求基本是最低的。如果是部署 qwen3.6-35B 级别,需要的资源少,但是任务成功的概率低。
  • beefhotpot 08-14 10:59
    16
    deepseek-v4-flash ,2 张 rtx pro 6000 可以跑。
  • zsj1029 08-14 11:01
    17
    h20 141 两张就够了 ds flash 很强,一步到位不要扣扣嗖嗖最后什么也搞不好
  • dcatfly 08-14 11:08
    18
    如果你本身比较了解模型相关的概念,可以参考 https://apxml.com/zh/tools/vram-calculator
    如果本身不了解,可以直接拿你的需求问 chatgpt ,再结合上面的做参考
  • qiuhang 08-14 11:11
    19
    @woscaizi #15 qwen3.6-35B 这种级别的,好一点的家用台式机都能跑
  • woscaizi 08-14 11:12
    20
    可以跑是一回事,能真的用起来是一回事。况且是 20-40 人使用
  • Inn0Vat10n 08-14 11:13
    21
    你要先说预算, 几十万,几百万,几千万,体验是完全不同的
  • darksword21 08-14 11:16
    22
    肯定 rtx pro 6000
  • 94 08-14 11:27
    23
    之前收集过一段时间信息,总结时就是 50 万起步最低档,而且只是低可用的状态。所以最后是找阿里谈商务,保密的部分合同上面写清楚就是了。
  • wwhc 08-14 11:29
    24
    1 到 2 张 RTX 6000 + Qwen3.6/3.8 27B + llama.cpp 应该够你们公司用了,不建议用 vLLM ,推理速度可能快些,但输出质量不如 llama.cpp
  • edw1n 08-14 11:38
    25
    当前最具性价比的方案就是 2 台 NVIDIA DGX Spark 来部署 deepseek-v4-flash 。价格可以控制在 8 万以内,基本可以满足 20 人同时使用的性能。
  • allinQQQ 08-14 11:59
    26
    2 台 NVIDIA DGX Spark 部署 deepseek-v4-flash
    GB10 性能比较差,双机基本只能 1~4 个并发
  • yanest 08-14 11:59
    27
    我们这边有数据中心用的 5090 货源,8 卡,五十多万,最近又涨了一点。不过性价比很高,他们说的 pro6000 十万多一张没有性价比,如果模型能用 5090 跑起来是当前最优解
  • yanest 08-14 12:00
    28
    五十多是整机
  • molvqingtai 08-14 12:04
    29
    GPT luna 不是免费了吗
  • restkhz 08-14 12:05
    30
    取决于预算。
    勉强能跑起来交差的,五位数不到,跑个 Qwen3.6-35B-A3B 还是够的,文档处理,简单编程能做。不过搞好了没几个人想用。
    5 位数算力带宽都好点的可以考虑比如还有几个小时就要发布的 Qwen3.8-27B ,能用。跑 Dense 要注意带宽。

    好用点的,能长期用的准备差不多 6 位数了。准备将近 200G 的显存吧。

    我这有用 H100+vLLM ,4K 上下文并发几十也没毛病。不过跑 Agent 上下文到 100K+明显卡 prefilling 。仅供参考。
  • enihcam 08-14 12:11
    31
    4 台 NVIDIA DGX Spark
  • VeteranCat 08-14 12:28
    32
    需要的显存至少按照 250G+准备,模型 v4 flash 就够用了,目前这个阶段的话是这样的。

    如果跑 Qwen,Qwen3.5-122B 也差不多了,不会说胡话,能跑代码,能跑文档。
  • shmilypeter 08-14 12:33
    33
    如果只是十个人以内用的话还好,其实一台 Mac Studio 或者说 4 张 5090 就可以。但如果你要五十个人的并发,而且还要高级模型的话,至少得准备百万级别的预算,而且还要配备机房和专门的维护人员。
  • ndxxx 08-14 12:46
    34
    @zsj1029 你这个方案大概是多少人用
  • sankeff 08-14 13:41
    35
    这个我是真部署了,4 张魔改 4090 48G 的卡;
    DeepSeek-V4-Flash 几乎只能一个人用。
    稍微流畅点儿的用的 Qwen3.6-35B-A3B
  • hisunny 08-14 13:47
    36
    给你个参考,4 块 V100 32G ,NVLINK 一代总线,用 lmdploy 跑 Qwen3.6-35b-a3b ,单线程能到 140 tps 。跑 Qwen3.6-27b 稠密,单线程能到 100+ tps 。整机 DGX-1,8 个 V100 ,当年(差不多 10 年前)卖 100 万。
  • ssiitotoo 08-14 13:50
    37
    可以租算力,我们公司租了 A800 40G 8 卡 一年 14w
  • Mzs 08-14 14:20
    38
    正经 50 人用 平头哥芯片 16 卡私有化部署 glm5.2 400w 元 勉强能支撑
  • superkkk 08-14 14:46
    39
    5090 跑 27b 的 qwen dense 模型 nvfp4 量化,或者 2 卡 pro6000D 跑 deepseek v4 0731 nvfp4 的量化
  • tcper 08-14 15:07
    40
    用买硬件的钱充 codex 或者 claude ,用到公司倒闭都用不完
  • pkxutao 08-14 15:24
    41
    真有意思,这个帖子让我见识到,哪怕是程序员,也存在不认真看内容、只想按自己的想法回答的现象
  • wqhui 08-14 15:26
    42
    最近刚刷到别人计算了一下,除非高强度使用,不然本地部署比买贵几十倍,差不多 20 年回本
  • Lighfer 08-14 15:42
    43
    实际经验告诉你:4*5090 部署 Qwen3.6 27B NVFP4 够了,我们 vllm 部署并跑了两个月了。

    我们部门 100 号人,实际在用这个模型的大概也就是三四十号人的规模,日常也就 4~6 个并发请求,缓存命中率最低 75%左右,有一段时间维持在 94%左右。

    除了确实偶尔会卡顿一下(来了个大请求 prefill 占了资源),日常还是很流畅的,多数时候每个请求基本都能维持在 40~75 tok/s 。

    当然,如果你们是要用来疯狂 vibe coding 那肯定就不行了,不过这个模型也达到可以随意 vibe coding 的能力。

    放几条日志上来看看,不是瞎说(贴图太麻烦了直接贴文本):

    ```
    (APIServer pid=1) INFO 08-14 07:32:44 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 6927.3 tokens/s, Avg generation throughput: 211.5 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.3%, Prefix cache hit rate: 75.5%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:32:44 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.77, Accepted throughput: 135.20 tokens/s, Drafted throughput: 152.80 tokens/s, Accepted: 1352 tokens, Drafted: 1528 tokens, Per-position acceptance rate: 0.931, 0.839, Avg Draft acceptance rate: 88.5%
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:32:54 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 3843.2 tokens/s, Avg generation throughput: 382.0 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:32:54 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.73, Accepted throughput: 241.65 tokens/s, Drafted throughput: 280.15 tokens/s, Accepted: 2417 tokens, Drafted: 2802 tokens, Per-position acceptance rate: 0.916, 0.809, Avg Draft acceptance rate: 86.3%
    (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found
    (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:33:04 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 1300.6 tokens/s, Avg generation throughput: 332.5 tokens/s, Running: 2 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:33:04 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.75, Accepted throughput: 211.70 tokens/s, Drafted throughput: 242.61 tokens/s, Accepted: 2117 tokens, Drafted: 2426 tokens, Per-position acceptance rate: 0.913, 0.832, Avg Draft acceptance rate: 87.3%
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:33:14 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 4531.0 tokens/s, Avg generation throughput: 204.7 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.4%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:33:14 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.90, Accepted throughput: 134.06 tokens/s, Drafted throughput: 141.16 tokens/s, Accepted: 1341 tokens, Drafted: 1412 tokens, Per-position acceptance rate: 0.970, 0.929, Avg Draft acceptance rate: 95.0%
    (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK
    (APIServer pid=1) INFO 08-14 07:33:24 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 10786.8 tokens/s, Avg generation throughput: 173.7 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.6%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0%
    (APIServer pid=1) INFO 08-14 07:33:24 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.83, Accepted throughput: 111.99 tokens/s, Drafted throughput: 122.59 tokens/s, Accepted: 1120 tokens, Drafted: 1226 tokens, Per-position acceptance rate: 0.949, 0.878, Avg Draft acceptance rate: 91.4%
    ```
  • zsj1029 08-14 15:47
    44
    @ndxxx 至少 20 人,vllm 一点参数调优,基本都是运维的工作,没有什么研发的内容
  • pingpp00 08-14 16:47
    45
    可以看看懒猫微服,他们有一个算力仓 128GB 内存,性能不知道咋样,你可以问问
  • ndxxx 08-14 17:57
    46
    @zsj1029 那这个成本还是挺高的😂
* 帖子来源V2EX
返回