Ox-alpha-free 模型 DeepSWE 能力评测,超过dsv4f/dsv4p,落后于luna

jyeric 2026-08-23 19:56 1

之前做过的评测: 【更新完毕】GPT 5.6 全三种模型 juice值参考 - 前沿快讯 / 前沿快讯, Lv1 - LINUX DO


最近还会做一个评测,感兴趣的可以关注论坛账号获取通知。


本文内容采用 CC BY-NC-SA 4.0 [协议内容] [法律文件]协议发布,转载请注明本贴链接,不可商业性使用本文内容。


针对于ox-alpha模型(不设置effort,opencode default是max),采用了 **DeepSWE**v1.1 benchmark作为评测基准。


对于113个test,每个测试单次测试,使用mini-SWE-agent(官网测试Harness),Pass@1 ,测试上限由默认1小时延长至10小时(tps过低),通过为73个,失败为40个,通过率为64.6%。



根据官网数据,目前模型软件工程能力位于deepseek-v4-pro之上,gemini-3.7-flash之下


更直观的,可在codexradar - 分布式雷达页面对比ox-alpha模型与其他模型的完成情况的用户脚本(需要tampermonkey):

ox-alpha-radar.user.zip (5.3 KB)


测试详细数据(每个测试对话、成功信息):GitHub - jyeric/ox-alpha-deepswe: DeepSWE pass@1 test for model ox-alpha-free from opencode · GitHub

最新回复 (15)
  • apparition 08-23 19:58
    1

    ox 符合预期,希望到时候便宜不降智


    我倒是觉得 3.7f 官方排名太高了

    每次 3.7f 回报时我都觉得它在骗我

  • Paul Adams 08-23 20:01
    2

    我也觉得,而且很懒,很自信,每次让他改一下东西,最后我还要亲自去看文档纠正它

  • jyeric 楼主 08-23 20:02
    3

    3.7f直观感受就是快(tps高)比较说人话,我写文档(或者让他修改gpt写的文档)都用3.7f

  • iswinnime 08-23 20:06
    4

    有种claude的说话气质,屌屌的,自信的一笔,主动性不足,执行力可以,基本不出什么岔子,识图感觉不是很强?这个不好量化评价,昨天晚上跑了一晚上手里的项目,明显感觉出世界知识有些不足,很多东西他不是很了解,所以导致在实现上没有达到优选,但是基本上我指哪里做哪里,要交代的相对清楚,完成度还是没有什么大问题的,速度起码快很多,感觉可以和sol高低搭配干活应该是不错的选择(前提要便宜)

  • wjy 08-23 20:08
    5

    Gemini3.7flash这么高?谷歌能不能给点力,Pro也雄起一把啊

  • 人间清醒指南 08-23 20:12
    7

    牛来 这个这几天用了不少, 相当蠢笨啊。 前几天速度快点还行, 错了多跑几轮还行。 现在估计用的人多了, 又慢又笨。 幻觉很多, 中途也容易暂停。 经常事情还没做完需求忘了, 或者不小心删错了代码, 很气。 muse 这个也不太行。不怎么会调用工具,这两天变得特别容易死循环。大模型在哪不停轮询问有没需求。几秒一次

  • test 08-23 20:13
    8

    你这个只做了1次吗,我昨天和今天测试了3次感觉opencode和or上的模型部署的不太一样,or上面的就在65徘徊,opencode反代出来就波动比较大

  • jyeric 楼主 08-23 20:16
    9

    做一次就需要2天时间了,目前没有办法多做几次

    如果有别人愿意做可以合并数据看能力

  • apomnz 08-23 20:41
    10

    我在推上看到有两个口径,一个和你这差不多,还有一个是大概是58.4%,和opus4.8差不多。MatchaOnMuffins/oxalpha 这个仓库

  • 钟阮 08-23 21:21
    11

    如果ox确认为GL系列,那就是B站上猜测是GLM-5.3-Turbo,参考GLM-5-Turbo的定价,便宜不了多少程度

  • jyeric 楼主 08-23 21:25
    12

    Errored trials 5 (all AgentTimeoutError)


    他似乎没有放开时间限制,我是放开时间限制的版本,因为tps过低


    然后还有 RepeatedFormatError,这个可能是模型提供方的思维链断连,我遇到过断连但是没有遇到过这个报错。


    可能会因为这些失败导致那份统计数据没有我这份高。

  • bfloat16 08-23 21:35
    13

    今天拿Arcaea的X-Random-Challenge做了一下benchmark,悟性比dsv4fga/dsv4pga高,但是明显不如GLM-5.3/Kimi K3,推测应该是GLM-5.3 flash,参数大概200-300b(?

  • dodo20 08-23 21:48
    14

    肯定不如dp4f的,完成速度比较慢,不是网速

  • apomnz 08-23 21:51
    15

    是的,我记得他说了有些超时失败的。我又刷到一个,63% 不出意外的话应该就是64%附近了。按稠密27b约等于120b,同时3.8 27b为最强推算,120b的极限就是3.8 27b。那么ox估计比上一代air的120b要大,应该是200-300b,A20-30b。

  • 若初 08-23 21:53
    16

    一个bug改好几遍幸好不要钱 ^-^

* 帖子来源Linux.do
返回