自建 DeepSeek-V4-Flash API 定价问题

daxy223 2026-08-11 18:09 1

最近和朋友集资买了两个 DGX Spark 部署了 DeepSeek-V4-Flash-0731 自用。参考 https://forums.developer.nvidia.com/t/deepseek-v4-flash-0731-dspark-1m-nvfp4-kv-2x-dgx-spark/378824 效果很好,爽的飞起。这两天和周围的朋友说到这个,其中有一些程序员和初创小老板们都很感兴趣愿意付费一起用。


想了一下我跟朋友也不是 7x24 全力在跑,而且两个 spark 6 stream aggregate output 能到 200tok/s ,确实有不少闲置算力被浪费了,可以开几个 API 给他们用。


所以想问问 V2 的朋友们定价问题。因为也不想搞什么复杂的算 input/output tokens API 计价,就是开一个 API 出来给身边人无限量使用。这样的话我应该定价多少钱网友们觉得是合理的呢?我自己查了一下,好像市面上的价格大概在 699 799 一个月这样子。

最新回复 (17)
  • malusama 08-11 18:11
    1
    官方定价不就好了吗? 699 799 感觉。。。如果是 code 没人会买吧?
  • daxy223 楼主 08-11 18:17
    2
    @malusama 我也这么想过,但是这个就要写用户管理和 token 统计了。我不想这么麻烦,想着就放个 vLLM 在哪里跑就行了,然后包月无限使用。
  • malusama 08-11 18:20
    3
    接个 sub2api 不行吗? 反正都是 ai 自己弄
  • zizon 08-11 18:33
    4
    梁文锋帮你精算过了,按六个月回本定价.
  • miniliuke 08-11 19:44
    5
    感觉官网这价格很难拼得过,除非有那种 24 小时不停跑的用户,定价低点卖给这个人
  • r6cb 08-11 20:19
    6
    @daxy223 #2 把 vllm 的 api 作为 newapi 的上游不就行了,哪里要自己写用户管理和计费了?
  • volvo007 08-11 22:51
    7
    DGX Spark 的跨机通信不是很慢吗?怎么做到 200 token 的,就是因为 MoE 架构吗?
  • cvbnt 08-11 22:55
    8
    建议先设置官方价格的七成,你还要算上电费宽带费
  • phrack 08-11 23:04
    9
    20 刀一个月差不多了

    再多就有点割韭菜了,当然能割到也是能力
  • Solix 08-11 23:27
    10
    呃,对外的话 RPM 和 TPM 都要高才行吧,因为是 agent 调用,几个人就撑不住了吧,不知道你压测过没
  • gpt5 08-12 00:25
    11
    1 个 stream 最快能到多少?
  • ntdll 08-12 08:08
    12
    咨询下大佬。我搜了下,看起来 DGX Spark 不像是能跑起来 deepseek 的样子,原生的性能也只是和 5070 上下。

    因此,这里实际上是采用 NVFP4 量化的版本嘛?
  • ajaxfunction 08-12 08:46
    13
    一个月 600+ ,没多少人接受。 算下来 1 年 6000 多了。 用官网的按量付费,除去节假日也差不多
  • ajaxfunction 08-12 08:47
    14
    @ajaxfunction 补充一个,官方的 api 用的人越多,命中缓存越高,我日常使用缓存命中 95%以上
  • NoDataNoBB 08-12 09:27
    15
    请求 first token 多久啊?有没有测评信息
  • daxy223 楼主 08-12 13:25
    16
    @ntdll 是的,看上面的英伟达论坛链接或者 https://github.com/tonyd2wild/DeepSeek-v4-Flash-0731-DSpark-1M-NVFP4-KV-2x-DGX-Spark
  • daxy223 楼主 08-12 13:26
    17
    @NoDataNoBB https://github.com/tonyd2wild/DeepSeek-v4-Flash-0731-DSpark-1M-NVFP4-KV-2x-DGX-Spark
* 帖子来源V2EX
返回