如何测试第三方 GLM-5.2 模型质量

haowang 2026-06-23 13:13 1

最近看到很多人都在推荐 GLM-5.2,但是抢不到智谱官方 GLM Coding Plan,于是订阅了一个 OpenCode Go 试试水。


通过直接调用 OpenCode Go API 可以观察到 OpenCode Go 提供的 GLM-5.2 模型来自于 Fireworks,如下:


{
...
"model": "accounts/fireworks/models/glm-5p2",
...
}

现在提供 GLM-5.2 模型的厂商这么多,如何评价孰优孰劣,有没有掺水、降智的情况?请问各位佬友有没有什么好的方法能测试第三方 GLM-5.2 模型的质量?

最新回复 (11)
  • outgoing 06-23 13:15
    1

    直接拿着用就行了,能完成任务就是好模型,没必要纠结满血

  • 英国龙虾 06-23 13:16
    2

    自己跑一遍swe bench pro或者claw eval呗

  • tHe One 06-23 13:16
    3

    之前用得少不觉得 一用多就发现ai的降智也够狠的

  • haowang 楼主 06-23 13:17
    4

    是啊,现在降智成常态了,真是难搞

  • lieyanqzu 06-23 13:22
    5

    不带系统提示词试试完成任务之后会不会自动跑Lint和测试

  • neteroster 06-23 13:25
    6

    没有可靠办法。


    本质上现在没有任何可靠方法能区分不同权重模型产生的输出,大部分方法都是依赖局部特征,这不完全可靠。

  • haowang 楼主 06-23 13:35
    7

    不带系统提示词试试完成任务之后会不会自动跑Lint和测试



    我用 OpenCode 让它“用 Python 编写一个科学计算器”,编写完成之后确定进行了测试,如下









    请问这样算是正常吗?

  • lieyanqzu 06-23 13:40
    8

    可信度比较高吧,很多评测都提到glm5.2会花费更多token去自我排查

  • apparition 06-23 13:48
    9

    我记得 OpenCode Go 有三个 (包含智谱官方) 不同来源

    不然智谱其实也撑不了这么大的流量

  • haowang 楼主 06-23 13:57
    10

    我记得 OpenCode Go 有三个 (包含智谱官方) 不同来源



    我倒是没有看到其他来源,我测了几十次,全都是 Fireworks


  • 好哦 06-23 14:01
    11

    这玩意几乎没办法验证,还是实际用一用吧。能完成任务的就可以,管他是啥

* 帖子来源Linux.do
返回