GLM 5.2最大的问题就是不是原生多模态

上玄 2026-06-17 23:31 1

5.2在从0到1的前端跑分第二,但是在某些需要复刻UI的场景下

光靠MCP的识图和web网页理解有局限性,有很多地方容易忽略


这时候就可以请出我们的GPT大爷来细微的修改了


这两天高强度用了下glm5.2,真不是尬吹,修改都是一遍过

原本只有5.5high才没编译错误,现在的5.2也能做到没编译错误

拿来做些比较复杂的公司业务也能处理,当然离无敌的fable5差距挺明显的


现在的体感就是跟opus系列非常像,不理解的话会主动问你(某营销号觉得需要像你确认需求是因为5.2不行,别人不确认都能完成,嗯说的就是gpt)


但是有个地方难绷就是搞完计划的任务,glm不跑了,在cc里面也没提醒。



然后在有些编译环境被占用需要手动编译的场景,也是自己停下来了,让你测试给他结果,但是cc依然无提醒,我还在刷抖音中 ^-^


目前我用的fable5的提示词给glm5.2,感觉更顺手了,但是不喜欢调用智谱的funtion calling了,不知道是不是12w提示词给智谱的提示词稀释了。

最新回复 (6)
  • 钟阮 06-17 23:33
    1

    听说多模态还在训练优化中,之前体验了一波5V,真是有了多模态,然后Coding退化了…


    看起来像是智谱对这种现状不满意,不打算直接落地多模态上旗舰模型

  • 蜗牛吃辣堡 06-17 23:38
    2

    晚上刚做一个需求,加上grill me Skill,问了我快二十个问题,问麻了 ^-^

  • 梓源 06-17 23:46
    3

    5.2在从0到1的前端跑分第二,但是在某些需要复刻UI的场景下

    光靠MCP的识图和web网页理解有局限性,有很多地方容易忽略



    可以让gemini或者gpt 还原ui做成一个html发glm试试

  • JARK006 06-17 23:59
    4

    目前国模无论哪家,在单模态的持续开发可以获得较大的能力进步,但是多模态基本就没几家能做出能力出众的,感觉还是架构上面的落后。


    纯文本模型的架构潜力还没完全释放,后训练还能继续蒸蒸日上。

    而视觉理解相关架构仍旧落后,有数据也不容易蒸出来。

  • ciarany 06-18 00:32
    5

    这是个问题,本地用的时候都是让glm5.2调kimi来当眼睛

  • key1 06-18 00:34
    6

    感觉问题在于慢,不知道怎么就是慢,不知道是不是算力问题,gpt同样一个问题可能只需要10分钟5.2需要30分钟 都能解决问题

* 帖子来源Linux.do
返回