编程效果对比 本地 Qwen3.8-27B vs Deepseek

ashong 2026-08-21 14:55 1

提示词


需要一个 svg 动画页面, 内容为一只鹈鹕骑自行车。要求:
- 鹈鹕生动形象
- 关节运动要自然、不生硬

除了 Deepseek 网页版,其他都是用 Deepseek Harness.


Qwen 模型均来自 unsloth


























































































模型 缓存量化(ctk:ctv) 耗时 轮数 平均输出速度 t/s 缓存命中率% 总输入 总输出 预览 费用(元)
Deepseek 网页 - 12 分 32 秒 2 - - - - https://dspage.previewship.net/ 0
Deepseek Flash - 38 分 27 秒 1 123 99 11.9M 266K https://dsflash.previewship.net/ 1.93
Qwen3.8 27B Q5_K_M q8_0:q4_0 5 分 52 秒 1 77 98 95.5K 26.5K https://q5kmq8q4.previewship.net/ 0.02
Qwen3.8 27B Q5_K_M q8_0:q8_0 23 分 20 秒 1 69 98 818K 111K https://q5kmq8q8.previewship.net/ 0.09
Qwen3.8 27B Q4_K_M q8_0:q8_0 16 分 13 秒 1 63 94 631K 67.7K https://q4kmq8q8.previewship.net/ 0.06
Qwe3.8 27B UD_Q4_K_XL q8_0:q8_0 16 分 59 秒 1 58 94 131K 57.8K https://udq4kxlq8q8.previewship.net/ 0.06

电费按 0.5 元/度计算


提示词语义比较模糊, 所以思考时长会多一些


本地环境


硬件:7900xtx


系统:ubuntu 26.04


软件: llama.cpp + vulkan


更喜欢哪一个结果?

最新回复 (33)
  • woodfizky 08-21 15:08
    1
    dsflash 怎么是倒着蹬啊(恼
    而且自作主张给你加了倍速调节。。
  • towser 08-21 15:09
    2
    看起来 27b 运行的还可以,超过我的预期
  • ashong 楼主 08-21 15:11
    3
    @woodfizky 迷惑啊, 等谷期再用 Pro 版试一下
  • sentinelK 08-21 15:14
    4
    这种纯视觉效果的 deepseek 吃了没视觉能力的亏,没法重复验证。
    我的实际运行体验,确实 qwen3.8-27B 至少是能生产的。只是 256k 上下文稍短。

    如果不是要跑 Minimax H3 总是倒腾显存,我就让 sglang+27B-fp8 常驻显存了
  • 1258 08-21 15:15
    5
    flash 想的太多了吧
  • ashong 楼主 08-21 15:16
    6
    @towser 能力可以,配合 dsh 比 opencode 效果好一些
  • yagamil 08-21 15:16
    7
    运行起来 A 卡和 N 卡去吧大吗?
    是不是只要显存大就行了?
  • ashong 楼主 08-21 15:20
    8
    @sentinelK 模型不支持,harness 自动下载安装了 pillow 截图,对比像素,其实之所以用了这么长时间就是验证耗时太长, 实际生成也就 10 分钟, 后续的验证修改了个寂寞
  • ashong 楼主 08-21 15:21
    9
    @yagamil 没 N 卡, 只有一张 7900xtx , 显存肯定越大越好
  • sentinelK 08-21 15:23
    10
    @ashong 有种说法是说,多模态模型对于视觉的理解,和第三方理解并文字化后输入,理解程度是指数级别的差距,但是不太懂这块,所以不敢下结论。

    我的体感上确实多模态模型对于图片的认知会更好。比如我用 qwen3.8-27B 去给 H3 理解图片素材并喂提示词,效果远强于纯文本模型。
  • sentinelK 08-21 15:27
    11
    @yagamil 可以参照我的经验帖: https://www.v2ex.com/t/1235518
  • wjxd 08-21 17:01
    12
    @ashong 我的是 7900xt ,昨天也试了这个 qwen3.8 ud q4 k m 的版本,你是用什么加载模型?是 window 环境还是 linux 环境啊?
  • wjxd 08-21 17:02
    13
    @ashong 忽略。我没仔细看帖子最后。。。
  • Seanfuck 08-21 17:53
    14
    最后一个好。Qwen 明显比 Deepseek 强。
  • honjow 08-21 18:44
    15
    同 7900xtx 。op 感觉用哪个量化最均衡啊
  • coefu 08-21 18:51
    16
    鹈鹕很 Q 。
  • xuhengjs 08-21 20:10
    17
    要不,用 deepseek 最新的 flash-vision-exp 试试?
  • ashong 楼主 08-21 20:29
    18
    @honjow Q5_K_M
  • jhytxy 08-21 20:34
    19
    建议量化模型至少还是用到 q6

    q5 离原版差的比较远
  • honjow 08-21 21:11
    20
    @ashong #18 上下文能开多少啊。我试了很多次都达不到 77tps 这个速度
  • ByteZone 08-21 21:22
    21
    48GB 的 mac mini 跑 QWen 3.6 27B 做 rag 慢的要是
    硅基流动一到两分钟 本地 ollama 要 10 到 60 分钟不等
    大佬知道问题出在哪里了吗
  • ashong 楼主 08-21 21:30
    22
    @honjow

    启动参数供参考:

    -t 10
    -b 512
    -ub 256
    --spec-draft-n-max 3
    --fit off
    --no-context-shift
    --metrics
    --kv-unified
    --jinja
    --cache-type-k q8_0
    --cache-type-v q8_0
    -fa on
    --spec-type draft-mtp
    --ctx-size 131072
    --parallel 1
    -ngl -1
    --chat-template-kwargs {"enable_thinking": true, "preserve_think": false, "reasoning_effort": "medium"}
    --no-mmap
    --temp 0.6
    --top-p 0.6
    --top-k 15
    --repeat-penalty 1
    --repeat-last-n 64
    --override-tensor blk\.\d+\.ffn_.*_exps\.=CPU
    --image-min-tokens 1024
    --no-warmup -
    -cache-ram 16384
    --alias qwen3.8-27b-q5km
  • PopRain 08-21 22:29
    23
    这个测试太多了,应该换个鸟,譬如鸵鸟再看看效果
  • pldxx 08-21 22:46
    24
    收藏一下
  • C64NRD 08-21 22:58
    25
    这个理解能力可以胜任很多 web 工作,就是耗时太久了
  • SiWXie 08-21 23:17
    26
    上下文大概能到多少呢?
  • L4Linux 08-21 23:18
    27
    https://simonwillison.net/2026/Aug/16/qwen-38-27b/
    一样的实验
  • niubee1 08-22 00:29
    28
    感觉可以用 GLM5.3 来驱动 qwen3.8 27B ,干起活来能杠杠的
  • Maboroshii 08-22 01:08
    29
    我看 qwen-3.8 27B 在 openrouter 上比 deepseek-v4-flash 还要贵不少呢
  • killadm 08-22 02:07
    30
    你的 q5 和原版 fp8 生成的差不多,但是用破限版的 int8 模型测试生成的动画反而车轱辘乱飞
  • ayyll 08-22 10:11
    31
    楼主你部署的这套设备多少钱?有超过 1w 吗
  • ashong 楼主 08-22 10:56
    32
    @ayyll 5 月买的,TUF B550 + cpu 5600 + 32G ddr4 , 全套不到 8k
  • sentinelK 08-22 12:34
    33
    @killadm 说明微调的时候只顾去拒绝率了,其他的对齐能力没管
* 帖子来源V2EX
返回