[nao榜]qwen 3.8 max正式版评测

listening 2026-08-04 10:53 1

逻辑成绩:



因为“雷霆大思考”,罚分太多,所以最终分数低于前代(不计入罚分则高于前代)。


编程成绩:



整体优于glm5.2,阻拦qwen3.8的更多在于相对昂贵的成本。

最新回复 (7)
  • 邱埋葬 08-04 10:54
    1

    有点昂贵了啊。感觉阿里不是特别上心呢。不过毕竟开源了,还是值得鼓励。

  • 索隆 08-04 10:57
    2

    思考链又长又臭的一律罚50分,纯参数+思考堆上来的,效果很失望

  • HeriX 08-04 10:58
    3

    qwen3.8 max是2.5T

    GLM5.2只有700多B

    成本也体现在价格上了

  • listening 楼主 08-04 10:59
    4

    编程:Qwen3.7-Max 在不同编程任务上偏差较大,处于部分可用状态。而Qwen3.8-Max 就目前已测试项目来看,则全部超过可用线,也领先中尺寸的 GLM-5.2。功能可用已不是 Qwen3.8 的目标,在需求拆解、审美、功能预判等方面表现同样可圈可点。



    • 近期一些模型在需求收尾阶段通常会开展极为庞大的测试,一个功能点甚至会写上百用例。而 Qwen3.8 的行为相对“复古”,只在功能完成后少量冒烟,或者在无头环境里截图确认一两次。测试少不代表代码质量差,从结果来看,Qwen3.8 的 Bug 也并不多,证明其直出代码本身就足够优质。审美方面,Qwen3.8 提升巨大。

    • 前代的 UI 遵循能用就行的最低标准,而新一代则带入了更多高级品味。在配色,尺寸,间距方面拿捏更到位。不过整体离头部的 Opus-5、Kimi K3 还有一段差距,达不到直接投入生产的状态。而且有些场景为了美观,甚至会出现功能让步。

    • Qwen3.8 面对棘手问题偶尔也会不择手段。比如遇到使用自己幻觉出来 API 反复报错,并没有去查证文档,而是选择破坏既定架构和开闭原则,把类的私有变量直接暴露出来,然后写一个正当化的注释“欺骗”自己。笔者的测试环境全部在沙盒中,Qwen3.8 遇到沙盒禁止的行为,也会花费数十轮尝试绕过沙盒,最终还是沙盒技高一筹,Qwen 功败垂成。

    • Qwen3.8 在面对陌生任务时的搜索调查意愿并不强烈。比如 J 项目本身难度不高,但涉及大量知识和数据查证工作,基本所有模型都会展开几轮到十几轮不等的搜索,而 Qwen3.8 是完全凭自己“记忆”完成的,展示出大尺寸模型该有的世界知识储量。只有在推进受阻,遇到疑似三方 Bug 时,Qwen3.8 才会向 Github 发起一轮源码查询动作。先前 Qwen3.7 的搜索行为也很克制,这方面算是一种延续。

    • 推理效率:前面提到,Qwen3.8 整体较前代上涨了 17% Token 开销,增量大部分来自指令遵循和约束求解类任务。尤其约束求解类,只要存在理论上枚举可能性,Qwen3.8 会不厌其烦的详细展开,仔细考察每一种组合可能性。个别题目较前代暴涨 700% Token 用量,不但触发长度惩罚,也极大拉高平均 Token。有些思考过程也存在浪费,比如题目只涉及一句引用,思维链却在背诵被引用的全文。但这种能力也有好处,在需要穷举所有结果的任务,Qwen3.8 也能遵守要求举出多数答案。

    • 虽然 Qwen3.8 的平均 Token 比 DeepSeek V4 Flash 低不少,但在复杂问题上,DS Flash 有概率在限定 Token 内也解出高分答案,而 Qwen3.8 则几乎都超长,导致 Qwen3.8 受到的长度惩罚更重。

    • 剧透内容幻觉:Qwen 团队在处理幻觉方面是有优势的,Qwen3.8 整体幻觉比前代又有精进,与参数接近的 Kimi K3 在同一水平。捞针类任务场景 Qwen3.8 表现要更稳定,也与官方宣称的提升吻合。

  • b9348 08-04 11:13
    5

    不是 这是什么标点, 全角数组?

  • 项太傅 08-04 11:41
    6

    现在用 Qwen 取代了 Gemini,搜资料真不错。搜索能力有差距,但模型聪明。

  • Silence 08-04 12:21
    7

    雷霆大思考其实能接受,等降价了。。。 不降价就算了,后面 DeepSeek V4 Pro 会教他做人~

* 帖子来源Linux.do
返回