本地部署qwen3.8 27b使用体验

xcstg 2026-08-18 09:30 1

模型发布的第二天就部署了,vllm环境跑的官方fp8权重+128k的fp16 kv,实际用了几天


测试了几个agent工具,opencode、reasonix、dsh,只有dsh勉强能跑起来,三档思考强度只有low可用,其他两档会在长上下文中陷入循环思考、问a答b、回答几轮之前的问题之类的种种问题,low下还勉强可用


官方模板的工具调用失败率奇高,用gpt5.6sol查日志,调优了官方模板以后,工具调用勉强可用了


全部调整好以后,用dsh让它做了一个本地vllm的监控网页(就是它自己跑的那台机器),监控一下硬件状态和vllm状态,pp/tp速度,改了几轮后成品还算可用


我的硬件配置是双2080ti 22g nvlink,开的mtp2,decode速度大概能稳定在50tp左右,中文问答场景下40左右


体感上智商比dsfv4还是差了不少,今天看到智力评分那么高,感觉很疑惑,难道是我的使用方式不对?

最新回复 (19)
  • mumuyoo 08-18 09:31
    1

    蹲一个佬的,详细测评,俺只会安装不懂测试

  • asxix 08-18 09:34
    2

    re-read

    re-think

    alternative analyse

    感觉太啰嗦了

  • Timmy_0 08-18 09:37
    3

    不会调,只能刚好跑起来,也可能我的卡不行, 单卡L20 只能跑17t/s,换成双卡也才28t/s。完全做不到佬这2080跑出来的50t/s

  • Rabe 08-18 09:37
    4

    3.8还有循环思考、重复思考的问题吗? 我在业务上用 3.7 27b 最难受的点就是循环思考重复思考的问题,最后甚至不如换成 122b 的 moe,理论上测评分低一点,但是循环思考问题好很多。。。

  • 我心永恒 08-18 09:39
    5

    不要使用 DeepSeek 的 harness (目前这个极其不成熟,离 claude code,codex 差得远)用在 qwen 这个模型上,请你使用 qwen code

  • 小勇 08-18 09:39
    6

    我是用codex接,跑的效果挺好的

  • 汉武帝(的大熊猫) 08-18 09:40
    7

    人家说的是就dsh能跑, 你还踩一脚…

  • asxix 08-18 09:41
    8

    有的,兄弟,有的。

    看思考过程会发现特别特别地啰嗦。

  • xcstg 楼主 08-18 09:42
    9

    一开始开的xhigh,他能跑完128k的思考不干一点事,降了一档到medium也是长篇大论,现在low还算是能跑起来,思考循环我不确定是不是一开始工具调用失败率太高导致的kv污染,现在好一些了

  • AmeowCAT 08-18 09:42
    10

    官方的jinja模板好像有点问题 问模型有哪些工具可用答不上来

  • 汉武帝(的大熊猫) 08-18 09:42
    11

    稠密模型其实不能用参数量玩数字游戏. 看着很小其实运算需求很高. 当然稠密模型有它的优点

  • wwtest 08-18 09:42
    12

    启动参数中加入 --default-chat-template-kwargs ‘{“enable_thinking”: false}’ 关闭思考 速度非常快 特别是TTFT

  • wwtest 08-18 09:43
    13

    我也部署了一个 用的公司服务器 效果确实不错的 勉强当V4平替

  • asxix 08-18 09:43
    14

    llamacpp

    -rea off也可以,但是这样特别笨。

  • xcstg 楼主 08-18 09:44
    15

    你带nvlink了吗,走的串行还是张量并行?

  • Timmy_0 08-18 09:47
    16

    services:

    vllm-openai:

    image: vllm/vllm-openai:qwen38-cu129

    command: Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 2 --gpu-memory-utilization 0.95 --mm-encoder-tp-mode data --enable-prefix-caching --enable_prompt_tokens_details --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

    我是这样配置的,基本没怎么改,直接参考 Qwen/Qwen3.8-27B | vLLM Recipes 这里的

  • xcstg 楼主 08-18 09:47
    17

    我看抱脸上说完全关思维链会变得很蠢,所以还是开了low档思考

  • xcstg 楼主 08-18 09:57
    18

    你的硬件配置是什么,主要是什么显卡?

  • Timmy_0 08-18 09:58
    19

    我是两张L20 48G的,我现在测试一下开MTP,加了个--speculative-config '{"method":"mtp","num_speculative_tokens":3}'我试试看会不会有所改善

* 帖子来源Linux.do
返回