分享一下 我觉得比较靠谱的两个[大模型榜单]

knowckx 2026-06-14 10:14 1

现在看大模型编程能力,我更倾向于需要去参考真实使用的榜单,而不是只看做题跑分能力。

做题,你们都懂,是可以专项针对优化的


我觉得比较有参考价值的两个榜单:


1. Agent Arena


地址 Agent Arena | AI Agent Performance Leaderboard


它看的是模型在真实 Agent 任务里的表现,包含了调用工具,终端出错怎么恢复能力,幻觉调用不存在的工具等等很真实的场景。

因为它不是单纯给模型出题,适合考查模型在真实多步骤任务里的表现。


2. CursorBench

Cursor 是一款 AI 的 IDE,所以他的数据来自于真实 Cursor 各种开发会话任务,属于第一手现场数据。


地址 https://cursor.com/cn/cursorbench


还有其他推荐的榜单,各位佬可以在评论区 安利一下!

最新回复 (4)
  • Hero9 06-14 10:21
    1

    第一个很详细 很早就用了。而且还提供免费模型使用

  • GloryDuck 06-17 13:23
    2

    好奇他的盲测数据从哪来的?


    只有web chat吗?因为我看它随便问一下能知道是什么模型了:

  • 啊~秋-秋-秋-秋-✧ 06-17 13:24
    3

    可以方便的对比同一个问题的不同答案吧,我一般都是直接问问题,不管他哪个模型

  • 落雪 06-17 13:28
    4

    livebench似乎也是很不错的榜单

* 帖子来源Linux.do
返回