模型的能力真的有很大的差距吗

xiaodigua 2026-06-19 01:50 1

我最近一直都在改我的比赛项目,我的项目之前都是让 glm5 给我跑出来的,结果跑出来效果不是很好,之后就越改越奇怪,搞得感觉项目好臃肿,都不知道该怎么办了,我的京东云订阅还有 10 天到期结果就用了不到百分之一的请求,里面的模型也就 glm5 稍微能用一点,我前段时间还用了 Claude 的 5 代模型分析了我的项目,他也觉得没啥问题,但是可能是代码逻辑之类的没啥毛病吧,但是我测试使用的体感还是不太好,ui 界面也是有点问题,页面加载,使用交互还是很差,我也不知道改怎么办了,还是说从零开发。


这个跟模型的能力有关系吗,我现在的想法是用现在最厉害的模型比如 glt5.5,glm-5.2 等等,但是我现在只有 glm5,还有一些公益站的免费 api,我现在甚至都觉得 glm5 在现在开来都好笨啊,对我的项目来说没有什么帮助,甚至担心它给我项目改坏了,哎好迷茫


模型的能力真的有很大的差距吗,可以用通过量去弥补能力上的不足吗

最新回复 (7)
  • 06-19 01:53
    1

    都不用不同厂商的模型对比,习惯了一种模型的之后,有一些看似不大的变化,实际使用体验也会有明显感觉。有种,“合作搭档今天心情不好”的感觉


    如果模型能力不够,或者出现了“降智”的情况,就可能出现一些问题来回反复改都改不好(需要很详细的给AI指出他那里错了才能改好,还可能在未来某次修改又给问题整回来)。

  • 卡里姆•汗 06-19 01:55
    2

    不可能的,除非你真的是代码高手,不过就算你是,也不太行,换模型吧,我之前搞一个项目,用gpt5.5和k2.6,k2.7,一直没有搞出来,现在用glm5.2,花了几天,轻轻松松就可以了,所以说模型做不到量胜过质的

  • 怒 天 06-19 01:57
    3

    有一个东西叫产品经理,其实还是很关键的。

  • 量子Bug 06-19 01:58
    4

    AI时代,必须花钱。不花钱的人体验到的,和花钱的人体验到的,真的是两个世界^-^^-^^-^


    用不靠谱第三方或者公益站的免费API,往往都是量化甚至掺水的,智商不可同日而语。

  • ANON 06-19 01:59
    5

    一定是有差距的,我觉得主线还是不要想着通过靠加大人类的工作量去弥补差距,想办法让自己用上更好的模型可能会更好一些。


    当然,肯定也是要考虑任务需求的。

  • ufhy 06-19 02:19
    6

    我个人的看法是,人类的区别要大于模型的代差要大于框架之间 harness 的区别


    在人没有区别的情况下,那就是模型之间的区别,或者是代差更大。如果模型没有变化的情况下,那就是 Agent 的框架的 harness 之间的区别比较大


    在之前 anthropic 的一篇 关于长时间运行开发的工具设计 的文章里提到过,他们之前在 Claude Code 里面为 Opus 4.5 做过很多的约束,也就是 harness. 但是当他们推出了 4.6 之后,发现 4.6 可以在更少的约束下获得相对更好的结果


    在文章中提到:


    As models continue to improve, we can roughly expect them to be capable of working for longer, and on more complex tasks.
    随着模型不断改进,我们大致可以预期它们能够更长时间地处理更复杂的任务。
    In some cases, that will mean the scaffold surrounding the model matters less over time, and developers can wait for the next model and see certain problems solve themselves.
    在某些情况下,这意味着围绕模型的脚手架随着时间的推移变得不那么重要,开发者可以等待下一个模型,看到某些问题自行解决。
    On the other hand, the better the models get, the more space there is to develop harnesses that can achieve complex tasks beyond what the model can do at baseline.
    另一方面,模型变得越好,就有越多的空间来开发能够完成超出模型基线能力的复杂任务的工具。

    所以模型之间能力的差距肯定是存在的。在 Claude 这边代差已经存在,更何况不同厂商之间的模型的区别,那可能就更大了


    但是总的来说,还是要看是什么项目和什么人吧。也不要太悲观就是了。最近的 GLM 5.2 也挺不错的

  • 咖啡泡橘猫 06-19 02:22
    7

    没体验过fable5一看就是,等肥波解封试试肥波吧 ^-^

* 帖子来源Linux.do
返回