qwen3.8 27B 被低估了

1258 2026-08-17 13:42 1

qwen3.8 27B 完全被低估了,讨论度不高。
如果有人在年初跟我讲,可以用两张 3090 本地部署一个超越当时最强的 opus4.5 几代的模型,我会觉得是痴人说梦。
感觉 qwen3.8 完全可以加入穿越者套餐了,穿越之自带太阳能发电板+本地部署 qwen3.8 27B 的硬件设备,再造人类文明完全不是问题吧
最新回复 (38)
  • yiranw09 08-17 13:51
    1
    你指 runinfra 免费的 qwen3.8 27B ?很奇怪的是我始终无法把他接入 hermes ,一直报错 Context length exceeded (16 tokens). Cannot compress further.
  • sentinelK 08-17 13:51
    2
    没有网络检索能力的小模型就是渣。

    小模型意味着信息量储备少,没有非常深厚的常识基础,或者说常识的抽象程度很高。
    如果没有外部信息做支撑,很容易产生很多没有细节的“正确的废话”。

    最简单的办法,你用 llama.cpp 的默认 web 应用调用一下试试看,直接就变成弱智。

    能力强的小模型很像中年老板。能量大,但其实不太关注信息量和细节。他的能力都来自于和外界的串联。你把他手机收了直接降级成中年油腻老头。

    相反,老版本的大模型像是老教授,不太会玩手机,所以显得很笨,很脱离现实。
  • 1258 楼主 08-17 13:58
    3
    @sentinelK 好比喻,也可以比喻成能力很强的年轻程序员,没有 github 或者网络检索很难凭经验解决 bug ,只能力大砖飞
  • 1258 楼主 08-17 14:00
    4
    @yiranw09 runinfra 的 3.8 居然免费了吗?这个模型部署成本确实很低
  • levn 08-17 14:03
    5
    都吹成本地的 opus4.6 了,还叫低估吗
  • 1258 楼主 08-17 14:11
    6
    @levn 是本地百无禁忌的 opus4.6 ,这很夸张了,你甚至可以要求他做坏事,或者在灰色地带赚钱,只需要付出电费。
  • nguoidiqua 08-17 14:15
    7
    其实 R 站讨论热度很高的,国内玩自己部署的还是相对较少。

    单看编程方面的跑分,略超 Opus 4.6 、MiniMax M3 、Gemini 3.5 ,略低于 Hy3 、Kimi K2.6 ,稍弱于 V4 Flash 0731 、Spark 1.1 、Gemini 3.7 、GLM-5.2 、Qwen3.7 Max 。(当然跑分这个东西仅供参考,各家跑分的排名都是出入较大的)

    不过目前反馈有:一、过度推理,xHigh 下面推理消耗的时间和 TOKEN 比 Medium 多几倍。二、偏科严重,相比 Qwen3.6 27B ,某些方面提升很大,某些方面反而倒退了。
  • coefu 08-17 14:37
    8
    1 ,deepseek harness + qwen3.8 27B ,自己修复自己 bug ,自己给自己写插件。

    2 ,联网,记忆,都让它自己写的插件。一个联网的小 case ,都还有很多搞不定。指点一条路,searxng 。记忆参考 benchmark: https://agentmemories.ai/home

    3 ,Hidden Dimension: 5120 ,Number of Layers: 64 ,dense 黄金比例下,参数有限,只能靠反复推理榨出更多智力,过度推理是代价,但是本地部署,无非多几度电罢了,终归能把任务完成。从 Hidden Dimension: 8192
    ,Number of Layers: 92 的 2.4T 里 蒸馏出来的 逻辑能力。就这么点参数,逻辑能力占多了,通用知识当然就少了。
  • coefu 08-17 14:49
    9
    它的对手是 早它几天开源的 Muse-Glimmer-30B ,glimmer 确实也很 ok ,但是 Hidden dimension 6656 ,Layers 52 ,比 27B 少了 12 层深度,虽然宽了点,表达更丰富。但是,在特定的领域里,比如 coding / math ,逻辑缜密性 比 表达能力更重要。这在具体任务上,通常就是 看起来在思考,但是最深层次的矛盾,总是擦肩而过,力有不逮的感觉。

    glimmer 适合写小说,写剧本,一定深度的任务。

    qwen3.8 是 coding 领域真正的生产力工具。
  • necZhang711 08-17 16:22
    10
    @nguoidiqua 求问,r 站是啥子
  • zhuantouer 08-17 16:40
    11
    x 上讨论挺多的,看老外的评价口碑还可以

    m4 pro 试了下,10t/s 左右,的确思考过度,蹲一下他们的 moe a3b 的模型
  • 1258 楼主 08-17 16:55
    12
    @coefu 666 大佬好专业的回答,自托管生产力我觉得是里程碑,毕竟电费直接转生产力了,而且可预见的是这一脚油门下去后面还会出现更猛的
  • 1258 楼主 08-17 16:55
    13
    @necZhang711 reddit 呀
  • coefu 08-17 17:10
    14
    @1258 推理端,其实还有更省电的。

    最屌的是 ,近存计算,在 ssd 上面焊接一个 FPGA ,把算子烧进 FPGA ,直接绕过内存墙。不过这个得看 FPGA 的算力进展了。或许也要单独供电,但是肯定也比整机功耗低。

    现在瑞芯微 RK182X 系列 就是在 m.2 上面搞得 堆叠 RAM ,有 1TB 的带宽,直接悍在 FPGA 周边的。不过容量被瓶颈在 5G B ,搞不上去了。还得是看 存储厂商。
  • realJamespond 08-17 17:52
    15
    opencode 批量重构调用子 agent 没有 3.6 好用,想半天,3.6 上来就直接干活,都是 unsloth ud q6
  • tt83 08-17 17:57
    16
    阿里云为啥自己不部署这个模型,3.8 Max 还是太贵
  • acerphoenix 08-17 19:42
    17
    @sentinelK 大模型只要不部署在私网不能联网,都可以自己外接 Agent 进行网络检索呀。就是现在单纯的哪个模型也没有网络检索能力呀,都是 Agent 给的。
  • jaoyina 08-17 19:46
    18
    27b 的 coding 能力能到啥水平?
  • 565656 08-17 19:50
    19
    @acerphoenix #17 有没有什么插件给 qwen3.8 联网的
  • Nzelites 08-17 20:36
    20
    27b 这么强那满血版的 3.8max 应该起飞啊 为什么好像口碑一般
  • Gylx 08-17 20:47
    21
    :)
  • ashong 08-17 21:23
    22
    7900xtx 跑 3.8 27B Q5 量化, 搭配 DS harness 效果挺好的, 比搭配 opencode“聪明”一些,输出速度 55 ~ 80t/s
  • LuoDiNate 08-17 21:27
    23
    qwen 的小尺寸一直都是神作
  • niubee1 08-17 21:27
    24
    想法不错,我已经去番茄开小说了
  • LuoDiNate 08-17 21:28
    25
    27b 到 0.8b 早就在推上被关注了
    https://x.com/sudoingX/status/2033020823846674546
  • catazshadow 08-17 22:23
    26
    @coefu 跟慕斯比这两个千问是真的慢
  • ashuai 08-17 22:48
    27
    35b 怎么还不发
  • coefu 08-17 22:53
    28
    @catazshadow muse 在 llama.cpp 里,经常思考的时候,重开一个 slot ,确实比 qwen 一直用一个 slot 快。每次切 slot 都重新榨干带宽。
  • coefu 08-17 23:01
    29
    @Nzelites 2.4T 几乎没有个人有资源能跑起来,Q8 都接近 2.5TB 的参数量了。单看 模型参数,Hidden Dimension: 8192 ,Number of Layers: 92 ,92 层深度,再复杂的小说,数学推理,都能搞定。8192 的层宽,表达能力以及领域知识肯定非常丰富。
  • levn 08-18 00:13
    30
    重复和循环的问题仍然会出现。medium 思考下比前代只是略有提高所以把 xhigh 设置为了默认。同时似乎染上了 opus 4.7-5 的那种非常令人讨厌的味道。
  • 1258 楼主 08-18 01:40
    31
    @niubee1 ?来个书名?!
  • restkhz 08-18 02:32
    32
    从 Qwen3.6-27B 开始“正确的废话”已经少了很多了...尤其是 3.6-27B ,答案质量比 Qwen3.5-122B-A10B 和 Qwen3.6-35B-A3B 好得多。很多时候未必需要搜索。
    已经不能拿着看 Gemma4,Qwen3 的眼光看这些小模型了。Gemma4-31B 就哪怕和 Qwen3.6-35B-A3B 比能力上都完全都不是一代的,虽然发布时间接近。


    3.8 不能说就是 opus4.6 的等级,有些指标差一些,有些指标超过。它知识量上和 3.6 比没很大提升,但是 Agent ,coding ,指令遵循能力已经很不错了。

    我这个实验室组周六就已经玩上 Qwen3.8-27B ,FP8 。有人跑 Agent 花了 40 分钟做了 3 个网页街机游戏。我也用它问了一些现代 EDR 和 shellcode loader 有关的问题,没开搜索,回答质量也非常好。能具体说出一些现代技术而且能解释为什么要这么做,具体原理,还能给出具体 API 。体验接近 DeepSeek V4 Flash 0731 。

    感觉这个东西已经到了可以当生产力工具的水平了。

    至于过度推理,3.6 就有这个问题了。27B 知识不足的情况下为了更好的质量只能靠时间换空间。不过对于自己本地部署来说我认为这是值得的。这就是那个不可能三角:好,便宜,快。你不能要求你只有 32GB vram 的情况下跑出 opus 的质量,还要求它快吧...

    不过确实热度不如 DeepSeek 0731.
    作为一个 27B 的 dense,推理成本应该比 0731 的激活 13B 高,应该会更贵。
    对于买 token 用的,和 0731 比 3.8 可能就又贵又慢了。

    ---------

    刚刚看了一下,artificialanalysis 给出了 52 分。
    超过了 opus 4.6.直接和 DeepSeek v4 flash 0731 一个分数了。
  • wwhc 08-18 02:39
    33
    在我这测试 Qwen3.8 27B 智商比 DeepSeek v4 flash 0731 高,DeepSeek v4 flash 0731 的智力水平在 Qwen3.8 27B 和 Qwen3.6 27B/35B 之间
  • flyws 08-18 08:21
    34
    Qwen3.8 27B 确实很不错,我使用几天了,在 DGX Spark 上面的问题除了慢,还真挑不出了,对于我的一个改 PDF 的 use case ,它表现达到了 opus 水平,完成了我的要求。同样的 prompt 扔给 DeepSeek v4 Flash ,GLM 5.2 ,Kimi3 都没有做出来(都忽略了保持背景颜色一致)

    我并不是想表达 Qwen 3.8 27b 暴打更大的模型,但是当我本地跑起来 Opus 级别的模型的时候,确实有一种原子弹爆炸的感觉。我觉得没有被低估,只是本地跑 AI 模型的可能还是少数,但是我相信未来这会变成大多数(都说 token 类比水电煤了,自己发电不好吗
  • mianma01 08-18 08:23
    35
    这个模型定价好贵啊
  • BingoW 08-18 08:48
    36
    求个建议:我目前机箱和电源( 850w )都只支持单卡,目前是 2080ti 22G 魔改,能跑 4bit 量化版本 但是 KV 不够了,上下文太短。想换卡,换 3090 24G 还是 4080s 32G 魔改呢?
  • wowo243 08-18 09:04
    37
    @565656 #19 接个 pi agent 然后 安装 pi-web-access 插件就可以了
  • wcwcxiaobin 08-18 09:07
    38
    @ashong 跑的什么框架速度这么快
* 帖子来源V2EX
返回