9月未解之谜:DSv4.1 Flash High思考强于Max思考

TOT 2026-09-13 00:22 1

雷达站,v4.1 Flash在DSH Minimal模式的测试,几乎已经测完了DeepSWE。


目前看分数High远大于Max。



甚至


大于Astra


最新回复 (12)
  • coding 09-13 00:26
    1

    这么离谱的吗?

  • sophon7 09-13 00:26
    2

    max思考太长了,感觉是过拟合的结果

  • fire_boy 09-13 00:27
    3

    是不是还是之前那样过拟合的问题

  • 🐟 09-13 00:27
    4

    雷霆大思考后遗症?!

  • TOT 楼主 09-13 00:36
    5

    倒挂原因:

    effort 是 token 预算旋钮,不是能力旋钮。

    论文自述收益前重,60–80 档已近 max 上限,且明确承认 Pass@1 与长度只是"松散相关、非单调";奖励只在同一 effort 子组内归一化,max 从未被要求"更正确",只学到"说更长、几乎不受长度惩罚",反而在 agent 循环里多出过度验证与环境崩溃。

    加上 FP4 KV、CSA2 稀疏选择和 SWA 近似重放会被长轨迹放大,再叠加 harness×档位交互、步数/时间预算和小样本噪声(如 86 样本那格),中档反超顶档属预期。


    故默认用 high,max 只留给单发难题。



    群友发的

  • 上杉九月 09-13 00:36
    6

    为啥啊 dsh 对 4.1 加强这么多吗???

  • 代码东 09-13 00:37
    7

    之前用dsv4f的时候,设置max感觉还行,现在用4.1设置max之后,对话又慢,结果还经常跑偏,这两天设置成high之后感觉好多了,对话速度也快,做事情也靠谱了

  • TOT 楼主 09-13 00:38
    8

    是的,我跑测试时候,用4.1flash配环境就发现了这个问题。

    max似乎没有任何提升

  • 代码东 09-13 00:39
    9

    不光没提升,,,感觉还有点拖后腿


    我是前天看有佬说设置为high会很好就修改了配置,一下子感觉顺畅多了

  • xsmingerfan 09-13 00:42
    10

    max的思考对智力没啥帮助,只是能跑而已

  • smsquirrel 09-13 00:46
    11

    也可以理解成后训练没有完全做好,更多的test time token预算没有带来真正意义上全方位的能力提升,甚至可能因为over-thinking导致能力下降

  • TOT 楼主 09-13 00:54
    12

    对,是这个意思。

    我今天切 high 之后,感觉世界都清晰了。

* 帖子来源Linux.do
返回