自部署deepseek flash

knying24 2026-08-14 11:40 1

准备自己部署一个deepseek flash,8*H100,主要是4个人用左右,低并发,准备在codex中用,大家有没有推荐的推理引擎,vllm或者sglang?这个预期的速度和官方api比如何呀

最新回复 (7)
  • shengmingboai 08-14 11:46
    1

    1、速度和效果肯定是不如官方的

    2、如果不是内网数据要求完全没必要自部署

  • knying24 楼主 08-14 11:46
    2

    官方checkpoint不是满血版吗

  • 浩尘 08-14 11:47
    3

    速度肯定要很慢,效果大差不差了。

  • 森亚露露卡 08-14 11:48
    4

    1. 自部署效果会略微好于官方 我有自部署 跑过benchmark

    2. 你这个硬件配置太好了 速度肯定是远大于官网的 官网在100t/s左右

    3. vllm好像有bug response接口 调用工具会出bug 现在我们用从chat接口代替



    这个配置甚至可以卖api


  • fcten 08-14 11:51
    5

    4 个人配 8 x H100 吗,做什么这么挣钱 ^-^


    应该很难用回本…但是速度一定是比官方API快的。官方API并发高,单个并发的吞吐并不高。

  • Noor9 08-14 11:59
    6

    蹲一下,我们是麒麟系,也在考虑怎么部,但我们卡就没这么豪华了

  • knying24 楼主 08-14 12:10
    7

    为什么需要回本,舒服就行了,这些卡还是有的

* 帖子来源Linux.do
返回