GLM-5.2 真是又快又蠢啊

金光暖暖推广者 2026-06-19 15:27 1

我给了 GLM-5.2 五次机会,放到 opencode, pi, 公司最简单的任务还是完不成,老出错,最后不死心放到 cc 里,还是不行,现在死心了


不知道网上为啥对这个模型评价这么高,我猜测是没人拿他真的做到真实世界的项目去,都是测试测试写写新的代码


而我们早已经把 agent 加入真实工作流里了


也可能我们的实践实在是太超前,目前来看还是只能由 sota 模型来完成,也就是 claude opus 4.8 和 gpt 5.5,还有个已死的 fable-5

最新回复 (18)
  • aviraxp 06-19 15:28
    1

    做比较复杂的底层C++开发任务,幻觉率极高,快确实是快。

  • yulingj 06-19 15:29
    2

    感觉glm 肯定是买了大量通稿的,然后也混了很多对国模充满期望的路人。glm 在国模里领先还是很明显的,不过参数太小了

  • ktze 06-19 15:32
    3

    快是从何而来啊 glm 这模型真的快吗

    glm 不是又慢又拉吗 那思维链我看着都力竭

    glm 和 kimi 基本是把 a/臭毛病都学到了

  • neteroster 06-19 15:33
    4

    要我恶意猜测的话我可能会觉得这是workflow落后的表现而不是超前的表现,如果你的workflow只有sota能完成,那几乎可以认为sota也不能稳定完成,如果workflow可以让弱一点的模型完成,强的模型才能完成的稳定(


    当然纯属恶意猜测,可以无视

  • zerosoul 06-19 15:37
    5

    你用的哪里的api,速度快是怎么回事?我几个渠道都感觉不怎么快。

    能力当前赶不上御三家,但国产第一应该是稳的

  • 金光暖暖推广者 楼主 06-19 15:38
    6

    GLM-5.2 确实挺不错的,决定搞个限时活动,2 折而且速度飞快


    速度不够快试试这个,fp8 量化的,tps100 左右

  • lueluelue 06-19 15:38
    7

    看思维链看的都绝望,有一种用纯语言思考的感觉

  • 金光暖暖推广者 楼主 06-19 15:40
    8

    你的恶意猜测其实很有道理,事实就是这样的,我们希望用人话让 agent 完成工作,而不是需要精确的提示和工作流调试。现实中的业务不像编码那么完备,无法验证没有准确实现路径。


    所以当强的模型能完成的时候我会感到很欣喜,终于很多事情能脱手了。

  • jcc 06-19 15:41
    9

    工作流设计的有问题吧,我用之前肥波设计的工作流,跑glm这个,还是很稳的。


    一个任务跑几个小时不跑偏,除了慢没别的问题


    真实项目大型代码库,前后端和依赖服务都在一个仓库

  • GPLer 06-19 15:41
    10

    评价模型行不行先说清楚场景,不然就会看到同一个模型风评两极分化,glm 5.2 是代码能力提升大,达到 SOTA 水平,不代表其他能力也是。

  • zerosoul 06-19 15:46
    11

    能力有满血版百分之多少?前面看一个帖子说能力跟满血版的差距比较大,我司最近也准备私有部署量化版,有点担心

  • karx 06-19 15:46
    12

    我猜测是没人拿他真的做到真实世界的项目去



    模型出来好些天了,全都是拿GLM5.2写写测试玩玩的吗 ^-^

  • 墨白 06-19 15:49
    13

    Teortaxes 给出了 7 个月的时间差判断,马斯克随即回复 " 可能(2027 年)第一季度 ",智谱 AI CEO 唐杰则直接表态 " 不需要那么久 "。

    马斯克随后补充,在基准测试上追赶相对容易,但以 " 真实实用性 " 衡量,明年 Q1 也已经相当出色。

  • Kyrie 06-19 15:51
    14

    佬请教一下工作流的设计方法,最近跑了很多token,但是都是时间稍长就会偏,不得不认为纠偏

  • xinyann 06-19 15:54
    15

    长链思考,效率怎么样啊,合适吗?

  • 42 06-19 15:54
    16

    也就是说佬要的是高泛化能力,那么glm的大小注定了是不可能的

  • jcc 06-19 16:01
    17

    就是把自己平时拆任务执行检查跑测试修bug核对设计提交代码,这一套流程在cc里让肥波做成动态工作流


    但是,先保证手动的时候能让他自己纠偏,然后工作流里,就也能纠偏了


    然后就可以直接调用了


    跑起来非常猛,一次一小时起,慢的话能跑六七个小时

  • 星火花葵 06-19 16:05
    18

    coding能力看实际体验,没哪个模型靠买通稿能买出来这样的风评的吧?特别是在L站。

    目前来看国内各种相关自媒体发布的相关内容并无异常,和往常其他新模型发布时的相关内容无异,拿公开的各种基准测试结果为准写写介绍再加些自己的实测。

* 帖子来源Linux.do
返回