pi 相同模型在一半的成本下,达到比codex/cc更好的效果?而 codex 是 5.6 表现最差的 harness?

ylxmf 2026-07-22 20:23 1

之前看到 Benchmarking Coding Agents on Databricks’ Multi-Million Line Codebase


如图,有趣的是,opus 换成 Pi,单任务成本可以相差两倍以上,而任务通过率大体仍处于同一水平。gpt 5.5 的话价格是1.5倍。



而且我们有理由怀疑,换成 sol 和 fable,这个差距可能会拉大。正好刷到了另一个X的帖子 https://x.com/mattlam_/status/2079605387121049605:


以5.6为例子,虽然表现看上去不咋地(这个没看他测试集是啥),但是tokens…差了快5倍啊。这是什么概念呢,我现在1.5个pro账号够用,如果真能这样的话,我甚至0.5个pro都够用了





测试集是 Databricks 自己的百万行生产代码库中提取真实任务,大部分是来自已经合并的工程师 PR,全面覆盖了不同语言和不同类型任务(前后端)





PS:个人使用体验因人而异

最新回复 (9)
  • 大屁股家的粑粑 07-22 20:26
    1

    我个人的体感是,我安装了pi agent,缺什么装什么,我觉得我的机器硬盘上,有他一份随时备用。

    他的设计理念非常符合我。


    现在就是codex玩下,拿pi 对比下

    玩下claude. 就拿pi 对比下。。。。。

  • edapan 07-22 20:31
    2

    现在pi agent 已经变成了我的样子

    xxx这个功能好,pi插件官网搜一下,有就安装,没有就自己写,然后pi 加上

  • Butterl 07-22 20:36
    3

    你们的pi都是什么形状,感觉使用上好像没有grokbuild 流畅

  • Wkstr 07-22 20:44
    4

    5.6 sol 在 codex 的适配没有 pi 好吗,codex 工程师可以撞死算了,我还是偏向于测试的问题

  • fengchris 07-22 20:49
    5

    只要肯折腾 pi就能变成自己最顺手的harness

  • ylxmf 楼主 07-22 20:51
    6

    5.5 都那样了 5.6 因为 pi 更灵活,限制少 也能理解,不过目前第一个测试比较严谨

  • 污斑兔 07-22 20:53
    7

    你们爱玩真好,我是闹一圈后嫖着公司的gpt无限额度,用着OpenCode SDK开发东西……

  • ppdx 07-22 20:57
    8

    昨天刷到了,细节忘了,应该是某大公司用内部的代码迭代作为基准测了一下。

    所以我觉得面向较为基础不棘手的问题,harness越多反而越累赘。

    但是一些棘手的问题,就真不一定了。

    大家都能完成(甚至哈吉米都能完成)的情况下,肯定越轻量化的agent 在token数上越有优势了。

  • wuxubiao 07-22 21:01
    9

    你们是直接折腾pi-mono还是Oh My Pi?

* 帖子来源Linux.do
返回