mac 本地部署 llm 不是最佳选择

Need4more 2026-08-31 17:00 1

有人说 AI 时代苹果是最大赢家,核心在于 mac 的成本优势,我不赞成。


在成本方面,按照我个人的使用经验,调用云端 api (我们假设使用的是 deepseek v4 flash)每日成本在¥25/天,如果购买 M5 Max 128GB (市场价 4w )的话,回本周期为 4.4 年,超过电子产品的 3 年折旧期。


抛开价格,我更在意速度和质量,日常使用体验直接和这两个挂钩,这块 api 明显占优,本地大模型量化后慢吞吞的、质量差要返工。唯一的优势就是隐私了,但是个人使用不在意这个。


毫无悬念,最佳选择是用 API ,买机器是负投资。




最新回复 (57)
  • sentinelK 08-31 17:07
    1
    其实这个逻辑很简单。
    如果只算经济账,自部署 LLM 性价比就能超过云厂商,那云厂商为何不用这款设备?

    自部署本质上就是一种反效率的个性化需求。即便如今 sglang 把 Qwen3.8-27B 的 prefill 性能和缓存巡回概率拉高到了和 API 接近的程度,且 flash-0731 涨价 5~6 倍的前提下,如果只算经济账,依然是不划算的。

    如果按照回本率来看,目前 5 系 N 卡+SGLang+Qwen3.8-27B 这套组合,应该是最接近同模型云厂商的。
    不光是 SGLang 的优化够强,还包含 Qwen3.8-27B 的云服务价格够贵。
  • lynn1su 08-31 17:22
    2
    mac 没法做到 1m 上下文把? api 是可以的
  • Need4more 楼主 08-31 17:24
    3
    @lynn1su 我说了,在速度和质量这块,本地大模型零优势
  • aimuz 08-31 17:28
    4
    M5 Max 128GB 能部署 flash-0731 满血版吗
  • aimuz 08-31 17:28
    5
    M5 Max 128GB 五年后残值还能值 1 万 吧
  • Need4more 楼主 08-31 17:30
    6
    @aimuz 明显不能,这个配置只能跑一些量化版本的,刚入门,不是最顶级的
  • kevan 08-31 17:31
    7
    如果只算经济账,自部署 LLM 性价比就能超过云厂商,那云厂商为何不用这款设备?

    +1, 卖的没有买的精吗?
  • x1aoYao 08-31 17:31
    8
    你只考虑经济,不考虑审查/保密这些特殊需求,那确实没必要本地部署
  • lesismal 08-31 17:41
    9
    1. 99%自部署的人都懂 OP 说的
    2. OP 不知道自部署的人的需求
  • sagnitude 08-31 17:48
    10
    @lesismal 事实上 99%集中发 mac 可以部署本地模型 的推荐和介绍帖子都不会提保密之类的真实需求,都会加上“买了就 token 自由”这种说明
  • lesismal 08-31 17:52
    11
    @sagnitude 价格本身就是一道拦路虎,买之前没几个不计算、对比清楚的,这种简单的计算和对比对于要搞本地部署的人来讲根本没什么难度。

    只有极少的人不懂却买了,比如一些小老板,跟着概念炒作就来劲,并且这点钱对于老板来讲也不多,就当玩也不觉得亏。
  • ahdw 08-31 17:54
    12
    这么算账的话,你买车的养车用车的钱,够你打车打一辈子。
    那为什么会有私家车市场?而且还不断普及、下沉?

    显然你少算了。
  • sn0wdr1am 08-31 18:32
    13
    本地部署考虑的是安全,隐私,而不是经济性。
  • ffalex 08-31 18:49
    14
    本地部署首先追求的也不是省钱吧?你让 claude 生成张色图,人家也不干啊
  • l1ve 08-31 19:04
    15
    你拿一个本身不是为了 AI 设计的产品去跑 AI ,然后说不是最佳选择?

    自建算力对外出售价是可以做到官方价格的 5-7 折,70%利用率下一年回本不是玩笑。

    你这就好比买了个玩具挖掘机,然后说这东西不是做工程的最佳选择
  • shyrock2026 08-31 19:09
    16
    都算经济账了,没有考虑一下智能硬件在持续涨价?
  • june4 08-31 19:20
    17
    @shyrock2026 把硬件持续涨价当常态了,看看以前内存是什么价,也就是这波 ai 突起产能跟不上,几年后可能又是一地鸡毛
  • Frankcox 08-31 19:23
    18
    你把两个问题混杂了。你说的成本问题是云端 vs 本地,而不是 mac 跑 AI 是否是最佳选择(相比于 Linux/Windows + Nvidia 显卡)。


    第一个问题算是日常问题了,你要只看经济成本云端自然有优势,但是本地模型配合 huggingface 的各种 jailbreak 破限,能提供完全无审核的内容,R-18,R-18G,极端内容等等。这对一些人来说就是刚需,更不用提其他对隐私安全有要求的企业人员。
    另外,很多任务并不需要很大很强的模型,不是所有人都要用 AI 作为 code agent 跑一堆高难任务超大上下文。我现在做文生图的 prompt 扩写,图像反推等都是用 qwen3.5-9B 的模型就能跑,效果还很不错。

    第二个问题,mac 称为本地 LLM 的最佳选择是因为 UMA 统一内存架构,Mac 内存价格是金子,那 Nvidia 显存的价格则是振金,而本地跑 LLM 的一个很大问题就是能不能把模型全塞到显存里。所以这么一看 Mac 相比于买显卡拼集群,反而是一个比较有性价比的选择。
  • Need4more 楼主 08-31 19:37
    19
    @Frankcox 你的回答很有水平。你说的这些需求当然存在,但我说的是日常干活的情况下(大部分应该都是这么用的吧),考虑性价比和使用体验,mac 本地部署不是个好选择
  • qiuhang 08-31 19:41
    20
    个人正常用自部署包亏的,很多自部署的往往是用来搞些商业模型不让做的事。比如搞色情内容之类的。
  • EdwardKot 08-31 20:16
    21
    标题没问题,但是你正文里不在乎的东西可能恰好是别人最在乎的的东西,本地部署 LLM 和 api 的区别,花了钱的人并且买了机器本地部署的用一下就有很明显的体感区别,不是必要的话没人想花了大价钱再捏着鼻子用
  • phrack 08-31 20:22
    22
    > 唯一的优势就是隐私了,但是个人使用不在意这个。

    不是哥们,个人使用最在意这个,你是正常人吗

    再说,我本来就需要电脑,能跑 llm 只是附带的价值
  • Joyflare 08-31 20:31
    23
    API 适合干正事,本地模型适合干‘不能给别人看’的事。你跟官方 API 提那些限制级的要求试试?能跑起来就挺好了,要啥自行车啊。
  • sillydaddy 08-31 20:31
    24
    回本要分使用情景的,跑满负载肯定是可以一年左右回本的。你要非用 1M 上下文,全速输出这种,那肯定回不了,因为机器的限制就在那。但是你的使用情景如果能跑满负载,忍受对话速度稍慢些,上下文小些,那肯定可以很快回本。

    另外大厂不部署,并不能说明不能回本。最简单的例子,1 立方米仓库可以容纳的计算密度,可能就完全把这个排除了!何况还有前面提到的每个人使用情景都不相同,大厂部署根本没有个人灵活。

    楼主拿自己每天花费 25 元来说不能回本,完全是站不住脚的。
  • Need4more 楼主 08-31 20:32
    25
    @EdwardKot 欢迎你分享本地部署的使用体验,而不是盲从别人
  • Need4more 楼主 08-31 20:46
    26
    @phrack 别人身攻击,这样显得你很没素质。
  • jetsung 08-31 21:13
    27
    自己部署的,可不止 DeepSeek 的模型,可以部署各种模型。所以没有可比性。
  • Gomoku2024 08-31 21:17
    28
    首先,电脑不只是能跑 AI ,同样不耽误用来做其它工作,不要用其价格来与线上 api 相比,因为就算有 api 你大概率也是需要一台电脑,配置也不会很低;其次,本地无限跑,可以试多种模型,这是 api 无法体会到的自由;然后,隐私和安全,可以不用在意 AI 知道你的关键资料和信息,这也是一种难得的自由;再次,在线 api 天然有各种限制,而开源破解模型束缚就要小很多,可以教你造 he 弹,出 H 图,这也是需求。最后,128G 内存的 Mac ,五年后肯定能到一万的残值。
  • phrack 08-31 21:29
    29
    @Need4more 不是哥们你怎么给我扣帽子

    我说了个人都关心自己的隐私,你说个人不关心隐私,我不得问问你是正常人不?

    你以为的正常人是什么意思?
  • Frankcox 08-31 21:40
    30
    @Need4more 我知道一个做文生图 lora 训练框架的开发者,因为打标 prompt 涉及萝莉等词语,开发过程中直接被 codex 封号,申诉也无效,这就是云端的问题。

    另外,如果你完全不考虑隐私安全敏感内容,只考虑性价比和能力,那肯定是云端强啊,fable 5 ,gpt-5.6 这些顶尖模型压根就不开源,你哪怕弄了个 1T 内存的 mac 也只能跑次等的 deepseek glm 等量化后的模型。

    所以这个问题本来就算不上问题,买 mac 跑本地模型的人压根就不会用到需要 fable 5 ,gpt-5.6 sol 极高,性能的模型,人家就是跑一些低等模型,你可以多去 reddit localllm 等逛逛,你就知道 qwen 3.8 27B 这种体量的模型已经是最受欢迎的了。deepseek 这种大型的模型都没几个人步数。

    最后,你可能低估了小尺寸模型的能力(我 4070 一直跑 qwen3.6 35B a3b ,这个模型已经能满足我日常 70 %的任务),严重低估了人们对无审核模型的需求(我知道几个搞 ai 色 q 的已经财富自由了)
  • Need4more 楼主 08-31 21:52
    31
    @phrack 我没有要说服你的意思。但你要是现实里这样的态度和人交流,是会被打的。
  • xing7673 08-31 22:11
    32
    比起经济性、隐私性,最主要的还是可用性
    ds v4 这种顶级 infra 在高峰期也有不可用的时候,对于 24 小时服务来说是完全不可接受的
    mac 跑 llm ,其他还有的优势是:
    物理:静音、功耗低(散热压力小,硬件损管工程要求低)、体积小、接口丰富有扩展性(甚至有逆向 lightning 接 pcie 的项目)、不亚于 4090 的内存速率
    逻辑:mac 系统、除 cuda 外的第二大模型运行生态 mlx 和活跃开源客户端 omlx

    综上:mac m5u 256 订单延后到 12 月不是没有原因的
  • Need4more 楼主 08-31 22:18
    33
    @xing7673 这个就和坚信那些买房是刚需的人一样,想买总能找到一百个理由说服自己。希望你能分享自己使用 MAC 跑本地模型的真实体验,直接打我脸。
  • Need4more 楼主 08-31 22:24
    34
    @Frankcox 你说的这些都对。我发帖的初衷是想说本地部署没有性价比和劣化的使用体验。考虑到 MAC 设备售价并不便宜,如果出于省钱目的消费的话,可能会让你失望。其他个性化需求当然存在,也很有价值,感谢你提供的信息。
  • xing7673 08-31 22:39
    35
    @Need4more #33 我现在 24 小时跑新闻爬虫+本地模型工作流,不然我为啥说这个可用性问题。
    当然我选的是 48g 内存版本,比我有钱有预算的选 256g 更无可厚非。
    红迪里用 mac 玩 llm 的和用多卡级联的人数占比都差不多,玩 localllm 就是看自己需求,我机器想放在我床边,那不可能用任何带物理风扇的机器
  • coefu 08-31 22:48
    36
    本地用来搞算法创新,idea 验证,讲真我不会希望我的 idea 被云厂商知道,并拿去训练新的模型。

    可能是买 api 做的事,没什么卵价值,厂商都看不来,不屑于用来训练它们的模型,搞不好还污染他们的原始训练数据。😂
  • EdwardKot 08-31 23:27
    37
    @Need4more #25 我有啥需要盲从别人的?我做的工作签了保密协议,我不知道 api 会不会泄露的情况下当然是我自己的本地 LLM 协助。你这人有点意思,你觉得你用不上,别人都是骗自己上的?然后呢?证明你是对的,我即世界?
  • wwhc 08-31 23:37
    38
    云 API 的一个致命问题是稳定性及可靠性无法保证,保不准什么时候就降智了,根据这个 API 之前智力水准订制的产品的产出将可能出现不可预知的变化;或者如果企业订购的某一个 API 因为厂商模型升级而废弃,企业根据这个 API 订制的产品将可能需要根据新 API 中的模型的不同特性而重构。本地部署完全没有这个问题
  • slowgen 09-01 00:24
    39
    你假设的数据让你得到了错误的结论,因为你假设的 token 处理量太低了,当然如果你每天就用那么多,那确实回本周期慢。

    我用 4 卡 RTX Pro 6000 跑 Qwen3.8 Flash Next NVFP4 ,现在一天最多是跑 54 亿 token(有峰谷,不均匀),还是因为 SM120 在新模型 Day 0 支持不给力,降级到了 marlin 的 backend 数据,要是用新内核估计处理能力还能提升 20%。

    结合 Deepseek Harness 一个/goal 开放式任务可以跑 20 小时以上,最近我做了 xterm.js 移植到 dart 和 CSharp 的测试,然后用 Flutter 和 Avalonia 复刻 tabby ,并且自我迭代优化,几乎是每小时跑 1 亿 token 输入,25 到 30 万的 token 输出,缓存命中率一般在 98%~99%。按照 Qwen 官方定价每小时大概消耗 12~13 元。

    现在我的 M2 Ultra 跑 Qwen3.8 Flash Next 的 4bit 量化,短的上下文时,prefill: 538.1 token/s, decode: 55.2 token/s ,长任务会衰减,假设这个数据在 M5 Ultra 上不衰减(因为增强了 AI 部分计算性能),根据 M5 Ultra 对比 M2 Ultra 的带宽差异计算,decode 的 token/s 大概在 80 ~ 100 ,prefill 速度估计可以 x10 ,这个意义在与有 KV Cache 的部分不用重复 prefill ,跑 Agent 新追加的上下文一般是并发读文件,追加的文件到上下文里几乎秒处理完,保守点的估计每小时 3000 万到 5000 万的 token 应该有,对比官方定价每小时消耗 6 元,一个月是 4320 元,M5 Ultra 256G 的 24 期免息分期费用每个月是 3615 元。
  • shmilypeter 09-01 00:50
    40
    买 M5 Max 加上大内存大硬盘的,其实很多都是有剪辑工作流需求的用户,自媒体创作者之类的。

    如果只是纯开发,M5 Pro 加上 32G 以上的内存,加上无限 token plan 其实就够了。
  • wangzr 09-01 00:53
    41
    只有你的需求是需求,别人的需求就不是?
  • chemzqm 09-01 01:05
    42
    deepseek v4 flash 用这玩意涨价前一天都得 20 多,现在翻倍都不止
  • yjiefl 09-01 07:21
    43
    本地只能跑一些专门的小模型可能好些
  • shyrock2026 09-01 08:12
    44
    @june4 #17 op 的分析就是以三年的折旧期为期限考虑的。这波硬件涨价潮持续三年的概率非常大。
  • edisonwong 09-01 09:40
    45
    我们二十台 dgx 自部署给研发用,各种调优,生产体验就是垃圾
    只是为了合规,离线,不泄露而已
  • Topmax 09-01 09:54
    46
    自己部署除了吃配置屎还要吃优化屎,简直屎上加屎
  • HENQIGUAI 09-01 10:20
    47
    这个逻辑非常奇怪,首先一个笔记本不是服务器,不是说除了玩模型就不能干任何事,就算是工作站、服务器也没规定只能一次做一件事吧,另外非得买最新最大内存的配置吗,M3Max 96G 行不行?直接便宜一半,体感还不一定有很大区别。最后,三年折旧期的算法是 3 年之后残值为零吗,如果这样的话到时候我出 500 块钱人民币购买楼主的 M5 Max 128GB 可以不,1000 也行
  • isbase 09-01 10:23
    48
    @lesismal 除了大企业和政企机构。 普通公司和个人使用 ZDR Provider 相比本地部署有啥问题么
  • homcrazy1 09-01 10:35
    49
    自己部署你想让他干嘛就干嘛
  • elboble 09-01 10:57
    50
    我个人经验是,速度凑合用,主要是上下文空间比不上云部署。

    P40 ,24G 的上古算力卡,Qwen3.8-27B-GGUF ,开了 mtp 最高也可以到 20tps ,干点小活也可以;但是 32K 上下文真不够,随便改个程序就 OOM 了。

    我在想能不能把上下文放主存,是不是不可行,或者会慢的令人发指。

    再就是噪音散热,P40 250W 的跑到 100%,只有一个后来加的小涡扇直接起飞,温度 89 度。其实散热还是不行,1 分钟以上就会掉功率降速。家里不让用,记得上次投诉是把矿机放家里的时候。

    综上还是掏钱买社会化服务方便。
  • moregun 09-01 11:21
    51
    这个有点类似买云盘服务还是自己部署 NAS 。本地部署的可以无视审查,防止数据泄露。
  • dushixiang 09-01 11:24
    52
    再等 5 年绝对有更适合部署 AI 的硬件,现在的显卡都是通用需求
  • Need4more 楼主 09-01 11:41
    53
    @HENQIGUAI 没说 mac 没用啊,如果你买 mac 的理由是部署大模型省 token 费,那就没用。而且,你确定 96G 能有体感吗?
  • CS50 09-01 12:11
    54
    API 没有 Uncensored 模型给你用
  • Rorysky 09-01 13:37
    55
    @kevan 云厂商要赚钱呀 哥
  • Serefrefee 09-01 13:49
    56
    我非常惊讶从头看到尾只有楼上一个人提到了 Uncensored
    这里的人既然都这么规矩为何还会翻出来?
    我本地部署只有一个原因 就是公网上的大模型都是审查版本 我想让 AI 教我些特别的东西公网版本的教不了
  • yshan 09-01 13:53
    57
    自部署一个是隐私,还有就是可以部署 无限制版本,机器折腾玩够了出手说不定还能赚
* 帖子来源V2EX
返回