GLM 5.3 Flash 吹得过头了

gorgias 2026-09-07 17:58 1

我不喜欢花时间给新模型试错,我觉得试错成本太高了,但是前段时间很多人都在吹Flash多牛。然后我特地去搜GLM 5.3 Flash的吐槽帖,只有少数人反馈说效果不好。


后来我高强度测试了,在我看来不会比DeepSeek V4 Flash好多少,它的优点是工具的调用准确,稳定性好。拿来做最简单的工作比较合适:比如信息收集、单一的问题分析、git commit之类的。


我之前一直用GLM 5.2做逆向和代码分析,也会用它开发代码。GLM 5.2在安全领域经验不足,但从未出现极蠢的情况,我一直都放心让它7x24运行,一般会加一个KIMI K3或者Codex作为监督(前段GPT时间Cyber告警了,只能用回K3)


之前给它一个Design.md,它乱改,直接在代码里面内联样式。

比如我给它提供源代码,让它把Windows GUI移植到Linux上,它就做不好,甚至乱创建目录,搞的乱七八糟。

再比如我给它提供GLM5.2分析的报告和源代码,让它分析更新后的代码,结果也不理想,虽然有正确的,但是大部分结论还是错误的。


如果说GLM5.2是一个普通刚接触职场的实习生,那么5.3 Flash就是那种你看了就想劝退他,只能帮你跑腿的实习生。


无法胜任我需要的工作(GLM5.2能做好的,它做不好),比如在我看来的普通的代码逻辑分析、简单报告、简单开发,它都不能胜任。

我对胜任的定义是:结果允许错误,但是在我的steer下可以修正。不能把项目毁了、执行流程和结果不能偏离需求太多。


不少人注意力稀释以为我在对比高级模型,这里要说明:



  1. 我不知道有免费活动,这个是私有部署的,也不是用不起其他模型,只是看到说5.3Flash超越5.2

  2. 其他模型我都用,没有要对比K3, Fable,GPT

最新回复 (19)
  • 嬴麻 09-07 18:00
    1

    刚上的时候都说不如ox alpha,没见几个吹的

  • ikb 09-07 18:03
    2

    GLM 5.3 Flash本来就是小模型啊,能耐就这有这么大(即使在小模型里也不算很靠谱的)。用户对其有过高的追捧和期待才会有这么大的落差。


    当然,把它作为主力模型可以磨练自己的意志品质。

  • KafuuKonata 09-07 18:03
    3

    都是Flash了,那肯定是同级里面对比,没比Deepseek V4 Flash好多少,但毕竟它现在的价格也摆在那里,比Deepseek V4 Flash便宜好几倍啊 ^-^

  • Z1rconium 09-07 18:04
    4

    还在ox alpha的时候网上都在吹,出了正式版以后似乎都不感冒了,还有有些在喷的,听说是降智严重。

  • 42 09-07 18:04
    5

    之前给它一个Design.md,它乱改,直接在代码里面内联样式。

    比如我给它提供源代码,让它把Windows GUI移植到Linux上,它就做不好,甚至乱创建目录,搞的乱七八糟。

    再比如我给它提供GLM5.2分析的报告和源代码,让它分析更新后的代码,结果也不理想,虽然有正确的,但是大部分结论还是错误的。


    如果说GLM5.2是一个普通刚接触职场的实习生,那么5.3 Flash就是那种你看了就想劝退他,只能帮你跑腿的实习生。



    是的,5.3f这个大小确实泛化差了一点,



    GLM 5.2在安全领域经验不足,但从未出现极蠢的情况,我一直都放心让它7x24运行



    5.2时期出现循环token的情况也是有的,其实还是不太能放心的w




    不过5.3f确实有点gemini类的信心过度

  • wjy 09-07 18:04
    6

    说glm5.3flash好是因为这个价格能达到这个水准


    复杂一点的逆向任务还是用glm5.3吧

  • 36.AI 09-07 18:04
    7

    最近连续两个周末,使用体验也是如此,免费我也不想再用了,时间消耗了,不出活,难受。不知道是不是 zcode 的原因,我在 cline 上用效果好于 zcode。

  • kingstacker 09-07 18:05
    8

    免费给我用 3 亿,好不好,我不知道吗? ^-^

  • 42 09-07 18:05
    9

    比Deepseek V4 Flash便宜好几倍啊 ^-^



    并没有w,在正常情况下把半价乘回去,面对日常vb的缓存率其实ds还是稍微低一点

  • alizoed 09-07 18:05
    10

    我直接直充api使用5.3flash做主模型,astra做advisor模型,效果挺好的,5.3flash确实会经常犯错,然后就能被astra纠正


  • 冉多福 09-07 18:06
    11

    我觉得简单的文档处理还是可以的。其他还是……考虑下

  • gorgias 楼主 09-07 18:06
    12

    之前没关注这个免费活动,是部署的。那时候很多媒体文章都在秀它的跑分,说它超越了GLM5.2

  • Hifumi Mizuhara 09-07 18:07
    13

    世界加钱可达

    实在不行用k3,Fable,Astra也不是不行

    可是我都用flash模型了,你就让让

  • gorgias 楼主 09-07 18:10
    14

    帖子从没说过钱的问题,不知道你提fabel和astra是什么意思。我自己也用其他模型,之前看到说超越GLM5.2,特地搜没搜到,测试一周后发现并不符合才发帖

  • KafuuKonata 09-07 18:10
    15

    我一般用的时候都是高峰期,接自己开发的Agent,现在DS涨价之后高峰期感受太明显了,不过最近我是在用Qwen3.8 Flash,感觉也挺舒服的

  • Wyrm 09-07 18:11
    16

    官方TokenPlan 的 GLM 5.3 flash



    真的一言难尽

  • Hifumi Mizuhara 09-07 18:11
    17

    自媒体乱吹不能信的。flash模型那个参数量就摆在那里,况且对于每个flash都有人发帖痛批的。小模型本来就是rl上去的,场景之间区别很大,所以要求高应该用大模型。

    乱吹不能信,但是说某某flash模型被过誉的说法也是非常非常多,看得有点审美疲劳了。

    就这么简单个道理

  • 42 09-07 18:12
    18

    flash的泛化还是差太多了w

  • kingstacker 09-07 18:20
    19

    比 d4flash 强一点点。

    毕竟免费,还是能干一点活。

    sol 生成干活 md 丢给它干就完了。 ^-^

* 帖子来源Linux.do
返回