CursorBench现在有公开页面可以查看结果了

raokj 2026-06-10 11:43 1

Claude Fable 5 遥遥领先啊(包括价格 ^-^),Cursor的榜单佬友们觉得参考价值大吗?

Cursor · CursorBench — Cursor · CursorBench


最新回复 (14)
  • 白芸汐 06-10 11:47
    1

    当然可信,这不是花了很多的钱,但是实际上提升没有太多,也就是比5.5medium高出五六个百分点,但是成本是好几倍 ^-^

  • Sokeu 06-10 11:49
    2

    看得出来, 和GPT5.5 MEDIUM难解难分.


  • 小小 06-10 11:51
    3

    composer 2.5分数这么高?

  • Jingo 06-10 11:52
    4

    composer2.5这么高? 我有点不信 ^-^

    怕是专门适配自家模型的测试吧 ^-^

  • raokj 楼主 06-10 11:54
    5

    之前没放自家模型的时候还觉得cursor有大量顶级模型的编码任务数据,应该榜单挺靠谱的,但是自家模型一放上去就让人有点怀疑了 ^-^

  • Jeremy1 06-10 11:55
    6

    排除掉composer, cursor看起来没有偏袒claude/OpenAI其中一家的动机

  • K0bayashi 06-10 11:58
    7

    首先忽略 composer,各家 AI 模型发布的 benchmark 关于自己模型的分数没有完全参考价值。它在自己 benchmark 规则里分数总是高的。

  • kinda66 06-10 11:59
    8

    cursor自家榜单的话,把composer刨掉应该就比较客观了吧

  • raokj 楼主 06-10 12:09
    9

    好好好,这么比是吧,那我kimi-k2.6也能和claude-opus-4.8连起来 ^-^

  • 企鹅 06-10 12:12
    10

    cursor还算是客观的,其实。

  • GLNCE 06-10 12:13
    11

    不是说composer2.5就是用的Kimi2.6做基底吗,所以这个在这个利好composer的benchmark里Kimi26分高也合理

  • Zzzzzzzzz 06-10 14:13
    12

    懂了,继续用gpt5.5,刚刚用Fable一个任务干掉cursor pro+的57%用量

  • love_ailixiya 06-10 14:24
    13

    还真是可信的 我最近用composer2.5 深有体会 他给我的感觉真是比4.6sonnet好

  • KiraraCat 06-10 22:58
    14

    这个榜单看起来,5.4和5.5性价比都很高。

* 帖子来源Linux.do
返回