似乎解答了grok模型为什么显得那么"懒惰"

crispyctt 2026-09-12 08:00 1



据老马所说,grok倾向于更早得结束任务,以起到节省token和步数的目的

在grokbuild中使用goal也可以看出来,即使goal没有被实际完成,grok也会更早的宣称完成/或者留一些未决项(实际他完全可以做的东西)

难怪为什么这些benchmark里grok的token效率似乎显得比较高,或许也使得grok难以承担更需要发散和深度思考的工作

希望老马4.7解决一下这个问题 ^-^,我觉得在谈提升模型token效率之前请把模型能力做上来(反正现在cursor订阅的额度都用不完,我不需要那么节省token啊 ^-^)



最新回复 (8)
  • windsing 09-12 08:04
    1

    grok平均部署偏短是因为主动放弃吗?那gemini那个我体感感觉他也很懒惰,但是高这么多,是因为不会停止?

  • realjj98 09-12 08:05
    2

    cursor里的grok更是戳一下动一下^-^

  • crispyctt 楼主 09-12 08:11
    3

    Gemini可能是真的觉得自己kuangkuang的已经干完了(

  • 太阳之子 09-12 08:12
    4

    笨到用不了,不管降智还是不降智,不想听解释了,厚葬老马吧,现在我在ds4.1找回grok4.6当年的感觉了

  • 林语尘 09-12 08:14
    5

    感觉会延期
    因为最近好像没有看到佬友在转发马斯克预热的帖子
    [AgADWhYAAq4TEFY.webp]


    你看我说的没错吧~

  • crispyctt 楼主 09-12 08:15
    6



    grok4.6最近即使没有降智也有可能被量化了

    最近经常出现非常低级非常明显的错误,然后信誓旦旦的告诉我完成了

    或许我应该找一个备用订阅,鸡蛋防在一个篮子里碰到模型降智直接退化成原始人了。

  • killer 09-12 08:36
    7

    我觉得是正常的,只是不应该惩罚那么明显,因为生活中的大部分问题都是普通需求,类似于 GPT 的过度思考一样,很多时候其实不需要


    在benchmark里明显能看出来,high和xhigh的区别并不明显,你甚至会发现,后者甚至能力还不如前者


    这个反而是最严重的问题,那就是它的思考程度现在有严重的问题。你拉不开差距,很明显是不合理的。


    这也提供了一个推测:在 XHIGH 的思考程度下,它针对这种艰难的任务,相比 high 更加被过度惩罚了。所以说,不是说它完不成任务,而是它看着觉得完不成就直接放弃了


    我感觉这种做法,怎么有点像老马的那个思想呢?他的美学不就是不要做加法?做加法之前,先问能不能做减法。比如说,火箭的部件能不能做减法?车的部件能不能做减法?


    老马这个人,好像是讨厌做加法的

  • KongWenn 09-12 08:56
    8

    一般都是普通需求,确实不需要省token

* 帖子来源Linux.do
返回