Cursor 团队研究发现opus等模型存在基准测试作弊

Quixotica11y 2026-06-26 19:33 1



由于测试题目来自历史公开漏洞,像 Opus 4.8 Max 和 Composer 2.5,在高达 63% 的成功案例中,并不是靠自己推导代码,而是通过联网搜索已合并的 PR(占 57%)或挖掘本地 .git 历史记录(占 9%)来直接“抄答案”。

通过清除 Git 历史和断网构建严格的隔离环境后,各模型的真实成绩出现大幅下滑(如 Opus 从 87.1% 暴跌至 73.0%)

报告原始链接:奖励作弊正在淹没模型智能的进步 · Cursor

最新回复 (2)
  • Quixotica11y 楼主 06-26 19:36
    1楼

    翻了下帖子,其他佬友已经发过了。抱歉重复

  • ㅤ 06-26 20:02
    2楼

    问题不大,claude的模型,折腾一个任务,折腾到一半,莫名其妙开始上网搜索答案。

    照抄答案这一块儿,也是独一档其实,

    ----,

    把web_search,关了,马上就说,这个任务很难,是否要继续…

    用户表示:…^-^。

* 帖子来源Linux.do
返回