现在有很多model的排行榜,有什么排行榜是 harness的吗?

云馨 2026-08-02 23:00 1

从各位使用 DeepSeek Flash 的蹬友,请立即更换 harness 到 opencode 请看测评继续讨论:


如题,现在很多很多LLM的排行榜, deepsweswe-bench, arc-agi, 等等,但是我发现现在并没有不同模型在同一个harness的对比排行榜:比如这里的 deepseek-v4-flash-0731claude code,pi,opencode等不同的harness的表现。


harness的选择就好像model的选择一样,萝卜青菜各有所爱,这是肯定的。但我还是想要知道不同的harnessmodel的影响。


在发出这个话题之前,我问了问gemini,gemini给出的答案是 Terminal-Bench,确实这里有一些,但是没有看到pi,opencode (可能是里面的openhands?) ,同时还有一些非常少见的harness.

最新回复 (16)
  • Decidable6471 08-02 23:01
    1

    我也在寻找一个类似的专业测评

    最有希望的可能就是 deepswe 吧

    还有那个智商雷达 我问过他雷达站长可以不 他是可以考虑

  • Pandoratobe 08-02 23:03
    2

    dsv4f在zcode表现最好,但究其原因发现其实背后是opencode魔改版本。

  • enget 08-02 23:04
    3

    harness 这个不太好评测吧,拿 sota 模型在所有工具里面跑吗?问题是想 gpt 和 claude 肯定是对 codex 和 cc 做了专门优化的,放到其他地方有很大概率不如原版。这个时候跑出来的结果参考价值,不知道大不大。


    我现在在做一个大模型的真实需求测试


    https://linux.do/t/topic/2690403/


    用了不同的 harness 和模型。主要就是测试各家工具和自家模型的适配度。

  • 云馨 楼主 08-02 23:07
    4

    这么一说,我感觉 deepseek-v4-flash-0731在opencode的表现好,是否意味着 deepseek的harness也是在Opencode上魔改的。

  • symbion 08-02 23:08
    5

    目前看下来就 terminal bench 更符合 harness 排行榜的了,GPT-5.5 时代 Droid 刷榜后体验了一下真的是个不错的 harness,后来模型更强了感觉 harness 带来的差异似乎确实小了很多。

    terminal bench 也有过一些作弊被扒的事,harness 里面的细节区别都太多了,哪怕同一个 harness 同样的题不同时间做出来的结果也会相差极大。

  • Pandoratobe 08-02 23:08
    6

    不排除,但是也不一定;因为它是要和PRO版本一起端出来的,等吧。

  • xx_yy1 08-02 23:09
    7

    不稀奇,小米的都是,因为opencode他的确有自己的过人之处,首先产品早,使用人群多,而且迭代时间长,很多东西都已经比较稳定

  • sandiferresner 08-02 23:12
    8

    我觉得 OpenCode 挺好的。它兼容性很强,很多插件和相关配置都可以直接适配。很多小众的Agent 工具其实都不是很兼容,装个插件都要想很多办法。

  • 云馨 楼主 08-02 23:14
    9

    确实,不同的公司也会按照员工的使用、模型特点优化自己的harness。所以某个公司的model+harness会至少是一个不赖的组合。


    但是harness的开发,现在还有人的参与。人参与了,就是一个变量,可能这个harness就偏离了本公司model的最优点。所以可能在其他harness上,本公司的model会有更好的效果。


    然后可能就有一个harness,会是当前相对更好的设计。


    所以拿每个公司的sota模型在各个harness上测试一下,我觉得还是有参考价值的。

  • ciarany 08-02 23:14
    10

    应该没有这种排行榜,但是harness也是不断适应和进步吧

  • enget 08-02 23:15
    11

    主要是 harness 变化太快了,测试很容易过期,而且很贵。

  • 云馨 楼主 08-02 23:19
    12

    现在的harness太多,确实会比单纯的测试模型要贵十几倍。 可能可以只测试harness大版本的更新。

  • 云馨 楼主 08-02 23:20
    13

    我目前确实没有看到类似的榜单。model在不断的进步有榜单,我们harness进步怎么不能有榜单了,气抖冷ahahhah

  • MaHuateng 08-02 23:31
    14

    持续关注,希望各佬能够找到相关的评测信息分享一下,目前我个人使用的是pi,然后安装了pi-web,目的也是希望更轻量化。但是目前体验还是不够优秀,需要搭配一些符合自己工作内容的插件

  • yooinsung 08-02 23:34
    15

    claude优化我信,codex真的有优化吗

  • enget 08-02 23:39
    16

    codex真的有优化吗



    有的,其他模型进 codex 都得水土不服,难道不是优化吗 ^-^


    他肯定是注入了什么只有 gpt 自己才知道的知识。



    只要没有 gpt 在非 codex 下表现更好的证据,就说明 codex 是对 gpt 做了优化的。虽然网上说 gpt 会在非 codex 接入的时候直接降智。


* 帖子来源Linux.do
返回