这次真的超过Opus4.6了?GLM5.2的实际工程编程测评成绩(Nao佬)

Eeevan 2026-06-13 15:55 1



我没看错吧,这个成绩应该真的能到Opus4.6Thinking了!!!A畜即将面临下架Fable的神罚!!! ^-^

别发布一周后猛猛降智,变成Z畜

完整榜单 LLM Benchmark Dashboard



我给新佬解读一下,每一列是一个大型测试项目,比如macOS应用构建,分值代表依据表现的扣分值,越低越好,等级表示实际编程体验评分,等级比分数重要。unprompt表示一个项目仅需初始人工指令即可通过。如果一个题目上代模型已通过,则新代不测,记为Skip。
从结果来看,大概是和opus4.6差不多,完全自主能力稍差,需要人类提示修复,但是整体错误会少一点


模型离A​^-^越近,道德就离A​^-^越近,达里奥的诅咒^-^
最新回复 (19)
  • Hylouis 06-13 15:56
    1

    冲啊!干爆A畜!!! ^-^

    zai牛逼!!!

  • Angel 06-13 15:57
    2

    如果是假的 我希望是真的 不管是国内哪个模型 脚踢claude我就得夸夸^-^^-^^-^

  • Rhine. 06-13 15:58
    3

    内测的佬也说很好用 但是好像没有多模态

  • chenlong 06-13 15:59
    4

    才出来的时候 都是拳打xx 脚踩xx , 实际一段时间之后才知道

  • Hifumi Mizuhara 06-13 16:01
    5

    国模我都顶,干翻A\人人有责

    这次能把中美AI差距拉到多少?

  • 吃豆人 06-13 16:01
    6

    A/倒下了了,接下来登场的是Z/^-^

  • 天然 天 06-13 16:01
    7

    有点抽象,这个排行写的 数字/字母 是啥意思?

  • 白嫖技术派 06-13 16:02
    8

    如果真这么强,那就牛逼了,可惜glm的算力资源太紧缺了

  • 项太傅 06-13 16:02
    9

    (帖子已被作者删除)

  • karx 06-13 16:03
    10

    智谱,你站起来了^-^^-^^-^加油啊,要是能能搞到更多显卡就更好了

  • cmpdke33 06-13 16:03
    11

    这榜真的?还能超Opus 4.6,甚至比开了high的5.4还高?


    但我有一个问题,为啥Opus 4.6没开推理也没开思考强度…

  • 智慧 06-13 16:03
    12

    不是多膜态,现在多模态还是挺重要的

  • Black Rock 06-13 16:04
    13

    就目前的体验来说,在美工设计的生图方面,国内还是没有能稍摸到GPT衣角的啊

  • HLiny 06-13 16:04
    14

    我给新佬解读一下,每一列是一个大型测试项目,比如macOS应用构建,分值代表依据表现的扣分值,越低越好,等级表示实际编程体验评分,等级比分数重要。unprompt表示一个项目仅需初始人工指令即可通过。如果一个题目上代模型已通过,则新代不测,记为Skip。

    从结果来看,大概是和opus4.6差不多,完全自主能力稍差,需要人类提示修复,但是整体错误会少一点

  • thisisfuture 06-13 16:04
    15

    如果能做到之前minmax那种只按照次数限制的token plan我立马把御3家的订阅退了

  • 蕾蕾的可爱多 06-13 16:05
    16

    这么强再加上能够猛猛蹬,就是国产的神

  • karx 06-13 16:05
    17

    这个榜还是很符合实际体验的,论坛里认可度很高

  • Dyna 06-13 16:05
    18

    如果GLM能够解决限速问题,我还真想订阅一个Max。

  • KiMelody 06-13 16:06
    19

    很好了,能有1m上下文可以解决很多问题,希望注意力问题能比5.1好,那就坐稳国模第一了

* 帖子来源Linux.do
返回