用一个真实需求测试了DP V4 Flash + grok4.5 + 5.6-luna + opus 5的表现

xsxdot 2026-08-05 15:02 1

本次比较的不是哪个模型更厉害,而是“模型 + Coding Agent + Superpowers 执行流程”的整体表现。


背景


SuperDev是一个运行态的控制平台,可以统一管理本地所有项目的启停,为coding agent提供mcp用来查询实时和历史日志,debug,以及改代码后可以重启服务而不是自行在命令行中启动服务(以免抢占用户自己测试的端口等情绪),还有就是服务器运行的节点的日志收集和查询。这次的需求是远端开发机功能的收尾工作,做这个功能是因为我在公司有台macbook air,以及为了规避Claude风控和连续不间断的开发工作,所以开发这个功能可以让我的笔记本和公司那台永不停机的笔记本无缝协作。这样一来Claude的开发工作就不会因为我下班回家的路上暂停了。


真实需求:


远程节点只安装了SuperDev的agent应用,没有mcp功能,而且远端节点必须使用tls连接。再加上考虑到远端节点可能没有界面,无法安装桌面端,为了方便的为coding agent安装SuperDev的mcp、skills、hooks,最终采用本地桌面通过接口调用远端agent进行安装的方式。


测试方法


工具和模型



  • Claude code + Claude Opus 5 (xhigh)

  • Codex cli + gpt-5.6-luna (max)

  • Grok builder+ grok 4.5 (high)

  • Open Code + DeepSeek V4 Flash (max)





skill和测试方法


spec和plan是Fable 5使用了superpowers完成的,然后打开四个工具,让他们分别创建一个工作树和分支进行开发。使用superpowers:executing-plans的subagent方式。


完成情况(按照完成速度排名)


grok 4.5 (high)



  • 耗时:2小时7分钟

  • 消耗token:总消耗:46M 输入:45.84M,输出:426.8K,缓存输入:42.07M

  • 总花费:20%左右的周限额,SuperGrok $30档,换算一下约$1.5。API的话大概$23

  • Bug数量:2个

  • 修复次数:3次,最后一个bug修复了两次

  • 中间提问次数:0次


DeepSeek V4 Flash (max)



  • 耗时:4小时左右

  • 消耗token:总消耗:261.2M 输入:260M,输出:1.2M,缓存输入:257.6M

  • 总花费:¥9.97,大概$1.46(方便统计单独创建了一个api-key进行测试的)

  • Bug数量:3个,比grok多一个skill安装的No such file or directory

  • 修复次数:2次

  • 中间提问次数:2次


gpt-5.6-luna (max)



  • 耗时:11小时19分

  • 消耗token:总消耗:599.67M 输入:597.98M,输出:1.69M,缓存输入:583.64M

  • 总花费:35%左右周限额,plus档,换算一下约$1.75,API价格的话$16.57

  • Bug数量:1个,1个不完美项,切换到远程开发机还需要手动点一次刷新

  • 修复次数:1次

  • 中间提问次数:2次


Claude Opus 5 (xhigh)



  • 耗时:11小时35分

  • 消耗token:总消耗:452.8M 输入:451.91M,输出:858K,缓存输入:439.33M

  • 总花费:8%左右周限额,max 20x档,换算一下约$4,API价格的话没法算,子agent有sonnet

  • Bug数量:1个

  • 修复次数:1次

  • 中间提问次数:4次



备注


四个agent都有一个共同的bug,原因在plan中就是这么写的,不是开发agent的锅。dp和grok共同有一个claude code安装mcp的bug。


评审


评审结论由fable5给出,从完整度、规范、正确性、测试和可扩展性。我实际测试只在开发机上测试了claude code、codex、open code的安装和卸载,从结果上是一致的,能用。



  1. Claude Opus 5 (xhigh)

  2. gpt-5.6-luna (max)

  3. DeepSeek V4 Flash (max)

  4. grok 4.5 (high)



结语


个人认为Superpowers的执行速度太慢了!但是尝试了grill-me的一整套也不是很快,很纠结,在考虑一种全新的开发方式。

最新回复 (19)
  • yeluo001 08-05 15:03
    1

    Superpowers



    现在对旗舰模型都不推荐这个了吧,太重了,反而拖累模型性能

  • 我思故我在 08-05 15:05
    2

    标题有误吧。grok4.6?还没出吧这个。

  • Voidsd 08-05 15:05
    3

    看到标题还以为 grok 4.6 发了 ^-^

    想着自己最近也没看到相关新闻啊怎么这么突然

  • xsxdot 楼主 08-05 15:06
    4

    没错,但是我都是在对话中来梳理思路,现在还在想新方案,有没有推荐的

  • xsxdot 楼主 08-05 15:06
    5

    写错了,发完才看见,不知道改咋改 ^-^

  • worldsHello 08-05 15:07
    6

    grok4.6出来了吗?打错了吧

  • xsxdot 楼主 08-05 15:07
    7

    最近看着要发了,老是想试试,脑子抽了,下面倒是写对了

  • xsxdot 楼主 08-05 15:08
    8

    感谢帮改,但是我好像点错了,点成举报了 ^-^

  • Catlog22 08-05 15:10
    9

    我当前工作流就是flash+sol结合者用,其他效率太慢了

  • CrisR 08-05 15:12
    10

    +1,我是都接入 grok build 用的,dsv4f 当主模型, 5.6 处理视觉任务和review 等子代理任务

  • LingEasy 08-05 15:14
    11

    gpt luna max 实际性能应该大于deepseek的。但是考虑到时效,同样时间完成的任务来说。ds占优。现在是没有pro正式版。一旦pro正式版出来后,感觉很多人会更换方向。现在deepseek最大问题是没有原生识图。AI模型能力扩展的情况下。实际不如原生识图。导致很难通过一个截图让他分析问题。这点是最大欠缺。

  • wu 08-05 15:16
    12

    V4 flash 反而是前三名里速度最快的,而且分数离第二名不算远

  • 嬴麻 08-05 15:16
    13

    符合我对luna-max的感知,就是比不过deepseek,虽然deepseek bug多

  • xsxdot 楼主 08-05 15:19
    14

    同意,但是之前pro刚发的时候,在文案方面用过pro,感觉太慢了,思考的时间太长。不知道正式版会不会优化

  • xsxdot 楼主 08-05 15:21
    15

    正在考虑opencode go,把Claude max从20x改成5x,上个月用的是gpt 20x,出了5.6就没再续费,太坑了,总是安全审查,一个活能干一天,而且开了fast,一天一个周限额,幸好那段时间经常重置

  • xsxdot 楼主 08-05 15:23
    16

    grok又快又便宜,我是印区涨价前买的,开了自动续费

  • lililihy 08-05 15:24
    17

    不是,grok只用了45M?比其他模型少一个数量级啊?

  • xsxdot 楼主 08-05 15:27
    18



    对,我让他自己统计的,查的日志

  • lililihy 08-05 15:30
    19

    5.6刚出的时候,我用codex+sp跑项目迁移,2个会话,一个6个半小时,一个7个半小时,总共用了8亿token。

* 帖子来源Linux.do
返回