模型能力验证彻底陷入死循环

温州程序员劝退师 2026-09-22 14:45 1

最近我正好有刷榜的任务,也正好有做题库的任务,突然觉得整件事有点扯


怎么证明一个榜有权威性?业界通常是找一些专家来构建题目(虽然干活的都是科研牛马)那么如果他不公开题目,我们怎么确定他是否是好题?有些佬友可能会说看跑分。但跑分其实只能证明这些题有区分度,但不一定是贴合使用场景的题

那么题目如果公开呢?很快就会成为厂商特需花训练的养料,有效性立即进入倒计时

想想都头疼

最新回复 (9)
  • Ys Ltr 09-22 14:46
    1

    让一个模型出题给其他模型做,交叉验证

  • 温州程序员劝退师 楼主 09-22 14:47
    2

    那就会陷入以谁为准的证明难点

    投票的话 也会陷入共识性错误的问题

  • 380kkm 09-22 14:47
    3

    训练集/测试集/验证集

  • Ys Ltr 09-22 14:48
    4

    以谁为准



    交叉验证不存在以谁为准的问题,只是其中的设计将会有点复杂,评分也会出现歧义

  • 翠花上酸菜 09-22 14:48
    5

    我觉得也只能不公布具体题目,仅公布题目的考察方向,同时强调仅供参考。具体好不好用其实无法给出一个准确答案,在某些特定需求上Astra可能完全比不上豆包

  • 宫野志保 09-22 14:50
    6

    定期解禁上期题库并发布新题库重测,还可以顺便看看哪个闭源模型偷偷降智

  • 温州程序员劝退师 楼主 09-22 15:09
    7

    我看了一些专门评测的厂商的做法 也是这样的

  • heidi 09-22 15:49
    8

    虽然不能验证这一代,但是可以开放历史题目验证上一代模型。问题是开放出来又由谁去评估权威性呢?

  • 温州程序员劝退师 楼主 09-22 15:50
    9

    敢开放意味着欢迎来 battle 虽然不一定有人来挑毛病

* 帖子来源Linux.do
返回