这个3B的模型,只提升可定量打分的能力,应该说是超级做题家吗?难道本地coding agent的时代来了?

xyfd 2026-06-17 23:13 1





是模型真的强,还是bench失效了?好像是两方面都有?


https://mp.weixin.qq.com/s/9KVW_zZynu5xXyUOCmsqYQ

最新回复 (8)
  • ANON 06-17 23:23
    1

    三个臭皮匠顶一个诸葛亮, 三个不够就三十个, 三十个不够就三百个.

    说不定可以依靠不差的做题能力 + 幻觉爆种取胜.

  • lmoonl 06-17 23:24
    2

    希望不是做题家吧

    我多少得去看看是怎么个事

  • SErAphLi 06-17 23:26
    3

    通识方面小模型是最难的,但是编程方面说实话应该是没有这么难的,逻辑清晰,奖励可以验证。如果编程语言再限制在这几个benchmark收集的语言上进行训练,肯定不难的。重要的是编程可以很容易的获得验证的奖励,而通识或者人类的指令跟随是需要大量的人类数据的。

  • 炫彩小鱼干 06-17 23:29
    4

    开放权重了吗?有第三方实测看看效果如何吗

  • seby 06-17 23:35
    5

    感觉像是偏科加RL filter,能力确实很吓人,不知道成绩可不可信。

  • xyfd 楼主 06-17 23:42
    6

    确实,他说的这几个场景应该做RL毕竟好做,有明确verifier

  • xyfd 楼主 06-17 23:44
    7

    理论上这种专用模型做算子优化之类的,很窄的任务,是不是有戏?

  • SugarBreeze 06-17 23:44
    8

    一般来讲,要么是一道高中数学题要思考几十万token,要么就是直接把测试集丢进训练集里面

* 帖子来源Linux.do
返回