很开心,跑通了deepseek harness反向代理+本地Qwen3.8-27B-FP8

ZySakura 2026-08-26 10:26 1

单纯分享一下自己的DSH,真的可以作为主力用了。

现在的DSH我是在家里的服务器,反代出一个域名,然后供内网(虚拟局域网)使用。


本地的Qwen3.8-27B-FP8是vllm的后端,rtx pro 6000 max-q跑。

Dsh中用qwen3.8,自带标准模式,未下载任何插件,用下来思考量感觉没想象中那么重。

原本我尝试在cherry studio使用同样的模型,做一个PPT都吃力,会输出被截断。

但是我在dsh中,一个对话里面的上下文256K,可以供我输出三轮不同的课件ppt,而且每一次的ppt指令遵循都还不错(至于我做三轮是因为我不断有新需求)



缓冲命中为0,但实际经测试是显示错误,依然可以命中我本地的缓存加速。


还没试过比较重度项目vibe coding,但是感觉中度的coding应该会不在话下。

最新回复 (12)
  • sasa001 08-26 10:28
    1

    直接把qwen3.8-27b 做成openai接口,给opencode 、pi里,直接就生产力了,屁事也少

  • hongdashao 08-26 10:33
    2

    qwen3.8-27b 这个模型 想要本地部署的话,得什么配置,体验如何,吐字连贯么,相比当前流行大模型,体验上 差距还很大么 ;

  • zerouscn 08-26 10:36
    3

    如果是 vllm,开启 --enable-prompt-tokens-details 就可以返回缓存命中了,流式请求还要加include_usage : true

  • ZySakura 楼主 08-26 10:36
    4

    @hongdashao #2

    我建议上双3090,这样预算最低且显存足够,这样用48G显存,可以张量并行,很多人32G的5090跑都吃力


    比起当前流行大模型,体验上肯定还是有一定差距。

    但是能省token钱。

    不过我觉得现在一个合适的harness工具可能更重要,今天我才开始尝鲜dsh,默认能力就很不错了。

  • ZySakura 楼主 08-26 10:37
    5

    @zerouscn #3

    感谢,不过我实测已经是有缓存命中了,返回不返回其实只是显示问题。

  • landorfelix 08-26 10:50
    6

    简单工作可以,但是编程肯定不行吧

  • 1952444901 08-26 11:07
    7

    注意安全性,大烧货的设计基本都是为了本地用的,鉴权很粗糙,不要直接暴露出来

  • kevin77 08-26 11:07
    8

    显卡多少钱?

  • ZySakura 楼主 08-26 11:25
    9

    @1952444901 #7

    我是局域网或者组网用的,公网用不了

  • ZySakura 楼主 08-26 11:25
    10

    @landorfelix #6

    见仁见智吧,我之前用qwen3.6-27B Q4也能编程。

  • ZySakura 楼主 08-26 11:26
    11

    @kevin77 #8

    入手的时候9W,现在可能是13W左右?

  • kevin77 08-26 11:56
    12

    @ZySakura #11 发布于8/26/2026, 11:26:10 AM

    @kevin77 #8

    入手的时候9W,现在可能是13W左右?


    666 公司的?

* 帖子来源NodeSeek
返回