有人真的用过 mini swe agent 来 debug 或是开发吗

yohjisakamoto 2026-08-09 08:43 1

之前看 deep swe 说 https://github.com/swe-agent/mini-swe-agent 比 codex 和 claude code 在 debug 中的 token 消耗和成功率都要好,我今天自己跑了一下,用 gpt5.6 sol 开 high 基本 token 开销比 codex 少 50%,成功率也高 15%左右。下面是我跑的测试数据:
https://turaai.net/benchmark
本来是想给我的宏命令做消融试验,但是单独只是改执行,不改提示词,token 消耗其实只减少了 16%左右,成功率提高 11%左右。


下面是 deepswe 官方的解释:
https://deepswe.datacurve.ai/blog/deepswe


简而言之如果光 debug mini swe agent 好像明显好过模型厂商的官方 agent harness 。

最新回复 (1)
  • txican 08-09 09:47
    1
    从理论上, 我相信面向编程的特化 agent harness 相比通用性的, 有可能做到 token 效率的优化.
* 帖子来源V2EX
返回