如果 2 - 3 万人民币设备,部署本地 dsv4flash , token 基本够用,你是会选择本地部署还是接云 api?

foryou2023 2026-08-24 10:46 1

The current q2 results use ds4-bench with the standard Promessi sposi
input, 2048-token context steps, and 128 greedy generation tokens at every
frontier. Each prefill number is for the next 2048-token chunk. The complete
sweeps are in m5_max.csv and
gb10.csv.





































































Machine Backend Context Prefill Generation
MacBook Pro M5 Max, 128 GB Metal 2048 790.18 t/s 39.35 t/s
MacBook Pro M5 Max, 128 GB Metal 16384 572.53 t/s 36.14 t/s
MacBook Pro M5 Max, 128 GB Metal 32768 557.04 t/s 34.36 t/s
MacBook Pro M5 Max, 128 GB Metal 65536 398.50 t/s 27.64 t/s
DGX Spark GB10, 128 GB CUDA 2048 825.76 t/s 18.05 t/s
DGX Spark GB10, 128 GB CUDA 16384 872.44 t/s 15.10 t/s
DGX Spark GB10, 128 GB CUDA 32768 855.94 t/s 14.43 t/s
DGX Spark GB10, 128 GB CUDA 65536 822.98 t/s 13.84 t/s

Older measurements for machines and model variants not rerun in this pass are
kept for reference. They used the earlier CLI prompt procedure and are not
directly comparable with the table above.






























































Machine Quant Prompt Prefill Generation
MacBook Pro M3 Max, 128 GB q2 short 58.52 t/s 26.68 t/s
MacBook Pro M3 Max, 128 GB q2 11709 tokens 250.11 t/s 21.47 t/s
Mac Studio M3 Ultra, 512 GB q2 short 84.43 t/s 36.86 t/s
Mac Studio M3 Ultra, 512 GB q2 11709 tokens 468.03 t/s 27.39 t/s
Mac Studio M3 Ultra, 512 GB q4 short 78.95 t/s 35.50 t/s
Mac Studio M3 Ultra, 512 GB q4 12018 tokens 448.82 t/s 26.62 t/s
Mac Studio M3 Ultra, 512 GB PRO q2 32768 tokens 138.82 t/s 9.56 t/s

以上是看 https://github.com/antirez/ds4 这个仓库的数据。


最近 dsv4 涨价太猛了,所以尝试找找本地部署的方案,找到这个方案,由于手里也没有设备同时也不太懂这个 速度的问题,也无法测试具体的实践效果如何,不知道有相关设备的朋友,能不能帮忙看看或者测试一下。


目前看了咸鱼 M3 MAX 128G 的大概 2.5 万左右,感觉按照 dsv4 flash 的价格的话可以接受本地部署了。M5 MAX 苹果官网看了一下要 5 万多,暂时没有这么多预算。

最新回复 (30)
  • donaldturinglee 08-24 10:53
    1
    2.5 万部署的能用在工作吗?生产环境还是直接上 API 吧
  • cvooc 08-24 10:56
    2
    现在迭代这么快, 本地部署 每秒几十 token 只能个人同一时间跑单任务用, 除非极度缺乏安全感,
    真不如 api 跑批量来的爽.
  • FakerLeung 08-24 11:10
    3
    我看双 DGX 好像能干到 4 人同时 50t/s ?还是 FP8 的精度?
  • xing7673 08-24 11:16
    4
    你这又是 q2 又是几十 k 的上下文,部署起来也基本没啥用
  • darksword21 08-24 11:19
    5
    没有意义,发这种 bench 的人也是闲的
  • crocoBaby 08-24 11:20
    6
    很多人早算过这笔帐,肯定是云 api 划算的
  • op351 08-24 11:26
    7
    现阶段肯定是直接买云服务商的算力
    云服务商都还在算力设备采购难,到货周期长,回本周期长的阶段,就不用想本地部署省钱这码事了
    现在本地部署的好处就一个 安全合规
    不存在本地部署吊打云服务商的算力和质量还能省钱的
  • ff521 08-24 11:35
    8
    hx170 这个破解的显卡有人玩过吗
  • rming 08-24 11:38
    9
    如非必要 勿增实体
  • xylitolLin 08-24 11:42
    10
    如果 2~3 万能部署到官方 api 的能力(能打个 8 折也可以)。官方也不至于涨价这么多吧
  • longaiwp 08-24 11:44
    11
    这还用算吗?就现在这个硬件成本,买 API 必然更划算。
  • imdoge 08-24 12:34
    12
    不是满血版,还 40token/s ,一个人用都嫌慢还不是满血
  • zisen 08-24 12:36
    13
    如果考虑硬件涨价的背景,可以买来玩玩,记得在暴跌之前出手就行
  • sillydaddy 08-24 12:40
    14
    DeepSeek 自部署可以 1 年左右就回本,但要跑满负载,单纯编程肯定跑不满。
    而且,考虑到各大厂的订阅套餐非常便宜,一般比 API 价格便宜 10x~20x 倍,订阅够用的话肯定订阅划算:
    https://v2ex.com/t/1235609#r_17991716
  • Retas 08-24 12:41
    15
    本地部署难崩的是算力只有下限,多个 Agent 就拉闸了。 用 API 跑上百个 Agent 并发洒洒水的事
  • gpt5 08-24 12:47
    16
    本地部署有其应用场景 但绝不是来当主力代码 agent
  • RandomJoke 08-24 12:48
    17
    你要达到 API 的推理效果,基本上硬件得投入百万级别。。。,还不算维护成本
  • kuhung 08-24 12:49
    18
    除非极度重视隐私,不然写代码自己搞一套没有性价比。
  • keppelfei 08-24 13:30
    19
    就目前市场看,2~3w 想部署一个 dsv4f,想常用感觉很困难
  • geese1028 08-24 13:42
    20
    我个人会选择订阅,不会考虑本地部署。3 万我可以把 super grok heavy 和 5x 的 GPT 订阅一整年了。1 年时间我觉得我的需求应该都能干完了。


    我个人并不在意大厂获取我的个人数据用于训练(我不用中转站)。如果我的数据对于训练下一代模型能有帮助,我将感到非常荣幸。
  • iv8d 08-24 17:09
    21
    有设备必须本地,要求并发后并且能开 max ,除此之外还是上 api 吧
  • refear99 08-24 17:16
    22
    M3 MAX 128G ,应该只能跑个 qwen 3.8 27b 吧? 还不是 8bit 的
  • mingtdlb 08-24 17:31
    23
    量化的跟原生精度的比,能力差点吧
  • HENQIGUAI 08-24 17:42
    24
    这个价格的设备怕是不行吧
  • foryou2023 楼主 08-24 18:19
    25
    @HENQIGUAI 看到有人说部署这个,满足正常使用,所以来求证一下,速率就是上面测试的结果。
    @refear99 跑的就是我说的这个。
  • ooppstef 08-24 19:25
    26
    如果自己部署划算,那云怎么赚钱呢。。。商业模式就不成立啊。
  • foryou2023 楼主 08-24 19:37
    27
    @ooppstef 不知道,我也在想这个问题,如果未来 2 万块钱就能部署本地的大模型日常够用的话,我肯定不会订阅了。这样想的话,大模型公司一定是赚企业的钱。
  • wwhc 08-24 23:09
    28
    Deepseek v4 flash 能用的起点是两块 RTX PRO 6000
  • Maxwe11 08-24 23:22
    29
    这个就像自己种菜和从农业工厂订菜,平摊成本决定了一定是工业化生产的平均成本更低,本地部署的,除非是有特别法律法规、隐私需求或其他官方不支持导致的无法使用因素,否则一定是 API 的成本更低(再补个漏洞:就是大模型这个也不能存在少数垄断,必须保持当下这种有开源有竞争的市场,否则垄断收割的镰刀更锋利)
  • bunai 08-25 08:29
    30
    买 api
* 帖子来源V2EX
返回