“马鞍税”,一篇非常有意思的 harness 横比文章

sentinelK 2026-09-17 13:16 1

https://harnesstax.github.io/


46985516-e0e0-4fdb-850a-42080de8334c-image.jpeg


我发现有几个非常有趣的结论。


0 、harness 基本不影响模型表现。


1 、文章中的模型,在别家 harness 中表现比自家更好……


2 、Pi 的效率最高。


3 、综合完成度 CC 最高,但是代价是接近 Pi 两倍的 token 消耗量。

最新回复 (9)
  • Tink 09-17 14:07
    1
    我之前用几个任务测了 Pi 和 CC,发现 Pi 确实非常省 token,但是质量一言难尽,问了几轮都达不到点子上,没办法换成 CC 一轮过去,然后又切回 Pi 继续干。

    后面就是优先用 Pi,解决不了的,切到 CC 干完再切回去
  • longaiwp 09-17 14:19
    2
    其实从这个测评来看,国产模型用 CC 还是很有道理的
  • sentinelK 楼主 09-17 14:22
    3
    @longaiwp 千问系列就明确官方跑分都是 claude code 环境,反正模型结构注定放弃响应速度了,不如提高跑分上限。
  • yh7gdiaYW 09-17 15:32
    4
    这两个评测集选择的非常差,SWE-bench Lite / Terminal-Bench 2 这俩在训练时已经污染了,pi 在新一点的评测集和实际项目表现中没有这么好
  • yh7gdiaYW 09-17 15:36
    5
    Terminal-Bench 2 的结果稍微正常点,SWE-bench Lite 的结果真是离了大谱,O/A 家的模型在对方的 harness 里居然跑分更高...我要是跑出这么个结果,不"优化"下数据都不敢拿出来
  • sentinelK 楼主 09-17 15:47
    6
    @yh7gdiaYW 可能是跟 claude code 接入 GPT 模型需要代理有关,代理还是有信息损失和额外干扰。

    不过这个结果确实有点娱乐效果。太逗了。
  • keakon 09-17 20:20
    7
    我也评测过,所以只用自己写的 agent
    https://i.imgur.com/a/0c6Sov2.png
  • keakon 09-17 20:23
    8
    图没发成功
  • greentim 09-18 04:43
    9
    我之前做过 不同 coding Agent 用 harness 和 原生表现的差距 https://mp.weixin.qq.com/s/k92i1_ORy5mDE1bOdRG-kw “理想照进现实:Kimi-K3 编程能力深度测评” 里面有 kimi3 、DeepSeek 。coding agent trae 、qoder ,对比非常明显
* 帖子来源V2EX
返回