OpenCode Go 的 DeepSeek 涨价,大用量的我想转向本地部署了

萝北来信 LuobeiLetters 2026-08-17 12:52 1

开始部署 Qwen3.8-27B !


我的家用机(4090D,24G)跑的本地 Qwen3.8-27B,量化 Q4_K_M(19GB)

高速的时候能跑到 50 tok/s(MTP 投机解码,草稿接受率 94%), 显存占用 23.5GB,但是只能打出 60k 的上下文了, 去掉 MTP 草稿也只能上 96K,确实也还不太够用… 我的内存有 96GB,这可以利用来强化它吗。


大家本地部署都用什么呀?





llama-server -m Qwen3.8-27B-Q4_K_M.gguf \
--model-draft mtp-Qwen3.8-27B-Q4_0.gguf \
--spec-type draft-mtp --spec-draft-n-max 2 --parallel 1 \
-mmproj mmproj-Qwen3.8-27B-Q8_0.gguf \
--cache-type-k q4_0 --cache-type-v q4_0
最新回复 (6)
  • 冰原Bill 08-17 12:57
    1

    v4-flash这种低级模型都需要四五十万的部署成本,PC本地模型真的敢拿来写代码么。。

  • 12dora 08-17 12:58
    2

    2台spark 6万块就可以了.

  • GPLer 08-17 12:59
    3

    2 x DGX Spark 怎么样,之前 5.5 万,现在只要 6.5 万,之前好像谁算过回本周期 5 年,现在涨价了感觉 1~2 年就回本了? ^-^

    65000 / 100 / 365 ≈ 1.78 (api 1 天 100,就是不知道自部署 60token/s 一天能不能跑出 100 块钱的 token 量)




    一台功耗大概 300W,一年 365 天电费: 300 * 2 * 24 * 365 = 5256kwh,按 1 块钱 1 度算,一年电费 5 千块


    0.22 * 365 * 100 = 8030 > 5256


    所以两台 DGX Spark 如果跑 DeepSeek V4 Flash 0731,一天能跑出价值 100 块钱的 token 的话,算上电费两年也回本了




    那么现在问题就只有 1 个了,两台 DGX Spark 一天到底能不能跑出价值 100 块钱的 token 呢 ^-^


    某黄鱼上租的话 61.25/台/天,想必大概率是跑不出来的 ^-^


    而且 256GB (实际更小) 是开不了 1M 的

  • 长夜 08-17 13:08
    4

    实测mac book pro 128g用ds4部署的ds4f水平不错。一个人绝对够用。

  • 青衫听涛 08-17 14:01
    5

    跑vibe coding编程肯定不行的,不然bug会改到死,在transformer架构时代,不要妄想自部署来替代APIKEY…

  • 12dora 08-17 14:15
    6

    为啥不行呢, 这个v4f部署的就是原版, 1M上下文, 和官方API接出来一模一样. 速度大概50-60token/s, 一个人用够用. 一些中转站就是这么部署的

* 帖子来源Linux.do
返回