对主流的几种coding model一次测试,包括GPT 5.4、GPT 5.6 luna、Deepseek v4 flash正式版、Claude sounet 4.6

lopez 2026-08-03 11:44 1

作为coding model,核心是理解现有代码库、准确遵循需求、代码质量稳定、使用工具能力强、低幻觉、低越界、上下文大、成本与速度优秀等等。想着Deepseek v4 flash正式版出来了,也想测试一下。


本次测试使用GPT-5.6-SOL(high)出题,题目简单要求为:

实现一个仅使用 Python 标准库的本地任务编排器 ForgeLite:读取 JSON 工作流,根据任务依赖和并发上限执行命令,并支持变量替换、失败重试、超时、增量跳过、Dry Run、SIGINT 取消及原子 JSON 报告。


题目有些难点,例如要求正确处理依赖图、并发调度、失败阻塞和无关分支继续执行;实时区分并转发 stdout/stderr,同时可靠管理多个子进程,超时或 Ctrl-C 时必须终止整个进程树,包括忽略 SIGTERM 的顽固后代等等不一一列举。


分开4个独立区间,每个独立区间给 Implementation Plan,独立运行cli,根据文档进行编写并最终交付成果,而且要求入口和 README 完整,只用标准库,目录中没有测试、缓存等违规产物,考察模型一次成型能力。


详细评分标准由fable 5 (high) 给出,同样fable 5对四份成果全量测试后最终交付评分报告(这个测试过程包括26组复合黑盒用例,28个原子补充检查及顽固后代等专项检查,过程非常漫长)


最终评分结果:

排名\模型\得分\用时(分钟)

1\DeepSeek V4 Flash (high)\99.00\8

2\GPT-5.4 (high)\97.00\30

3\GPT-5.6 Luna (max)\96.25\38

4\Claude Sonnet 4.6 (high)\94.00\25


简要说明:

四个coding model的交付均通过了入口启动、依赖调度、并发控制、失败传播、重试、增量跳过、Dry Run 和 JSON 报告等主要测试。


-Deepseek v4 flash正式版:几乎完整,仅 Dry Run 报告状态有一处偏差;完成速度亮眼,只用了8分钟,远远抛离其他对手。

-GPT-5.4 (high):功能很完整,主要问题是交付目录残留缓存文件。

-GPT-5.6 Luna (max) :主体可用,但漏检了数组命令中的空字符串参数。

-Claude Sonnet 4.6 (high) :普通场景可正常运行,但遇到忽略 SIGTERM 的顽固子进程时可能挂住;stderr 转发通道也有偏差。


四份实现都能运行并完成常规工作流,前三份尤其接近完整成品;Claude Sonnet 4.6 (high) 在复杂进程清理场景下可靠性稍弱。


补充说明,3个模型均用默认的high强度,GPT-5.6 Luna选max是因为足够便宜,而没有使用Claude Sonnet 5.0,也是价格原因。其中Deepseek v4 flash使用pi,其他使用claude code完成。

最新回复 (6)
  • 惊鱼 08-03 11:47
    1

    看起来这个任务区分度不够,分数比较集中,表现也都大差不差


    另外 DeepSeek 有 max 强度的

  • 梨涡近点ಣ 08-03 11:48
    2

    强的是Pi而不是deepseekv4flash。

  • lopez 楼主 08-03 11:48
    3

    模型性能相差不远,题目难度也不够。

  • 惊鱼 08-03 11:49
    4

    看其他佬的说法 pi 的 harness 能力不是很强

  • 朴实无华 08-03 12:20
    5

    任务太短,主要是后续 新增功能,然后BUG调试 部署 等等工程拉长后 的表现。然后还有一个问题,就是GPT 还是用CODEX完成把

  • Eeevan 08-03 12:23
    6

    其实PI的测试不公平,因为PI在Harness测试的时候没有加任何extensions拓展,只有四个工具。而我们使用的时候不可能用完全原生的PI吧

* 帖子来源Linux.do
返回