这两天总算是体感了一下 chatgpt(codex)和 workbuddy 之间的差别

starwishzzgg 2026-07-25 11:52 1

想做一个武侠游戏,准备先收集整理一下金庸相关的武侠作品内容,包括门派、人物、武功等,并且根据关联关系建立武侠知识图谱,为后面做游戏做些准备,于是先用 Chatgpt 来干,活又细又慢,耗掉了我 5 个 plus 的重置,基本形成了一个数据基础,基于此生成了一个网页来查看相关关系和具体细节,我把我最熟悉的相关门派、人物、武功都看了一遍,除了有缺失的,基本没有错误。


忽然突发奇想,反正 workbuddy 也有之前薅羊毛来的几千积分,想对比一下区别,于是乎用同样的提示词输入 workbuddy ,惊喜的是速度比 chatgpt 快几倍,过程中观察发现比 chatgpt 少了不少交叉比对来验证数据结果的正确性,结束后也生成了一个网页来查看关系和细节描述,同样去看我最熟悉的相关门派、人物、武功,发现了近 10 处细节错误。


从过程差异来看,感觉模型处理这样的任务差异不大,似乎主要就是缺在交叉验证数据结果这块,侧面思考一下,各个 agent app 的 harness 设计还是非常重要啊,

最新回复 (14)
  • calvinHxx 07-25 13:09
    1
    你来回核对 workbuddy 细节、修补漏洞的时间远比你等 gpt 生成慢 成本要高的多的多
  • getadoggie 07-25 13:14
    2
    所以是不是还是 harness 流程设计很重要 可是现在有相关比较完善的开源项目吗,我感觉都找不到
  • Solace202 07-25 13:45
    3
    我也觉得,其实大部分代码编写场景其实流程更重要,我觉得写的快了,那如何测试更重要,我甚至认为测试是最需要尽快处理的问题了。
  • cnightmare 07-25 13:58
    4
    模型能力差太多了,这些 agent 都是互相抄,大差不差
  • bigdogbigpig 07-25 14:24
    5
    应该让 codex 用便宜的模型,这样速度可能慢一点,准备用效果可能也还行
  • ldy619354397 07-25 14:32
    6
    模型能力查很多
  • leihaibo1992 07-25 14:36
    7
    你确定你对比的是 codex 和 workbuddy 吗,你对比的明明是顶级模型和一个免费的垃圾模型
  • leihaibo1992 07-25 14:39
    8
    agent harness 不是什么高深的技术,现在市面上叫得上名字的 agent harness 不会有什么显著的差异,前提是得用相同的模型
  • yidinghe 07-25 14:47
    9
    这个场景重度依赖网度搜索工具,搜索质量差,模型再聪明也是白搭。
  • yunpeng2015 07-25 15:09
    10
    应该用 codex + 一个便宜模型, 然后对比 workbuddy + 一样的模型
  • zhw2590582 07-25 16:06
    11
    workbuddy 现在可以控制电脑和浏览器吗
  • kirbyzhu 07-25 20:27
    12
    workbuddy 根本不能用
  • Deshun 07-25 22:23
    13
    WorkBuddy 有一些专家,比如深度研究专家或者专家团,可能会有交叉验证的逻辑。
  • zerovoid 07-26 02:28
    14
    你是想比较模型能力,还是 IDE/CLI 能力?
* 帖子来源V2EX
返回