codex 真的过于防御性编程了

lukejr 2026-08-06 01:35 1

动不动几十个上百个 test case

他是准备转行当 qa 了吗

最新回复 (34)
  • verse4 08-06 01:36
    1

    是这样

  • 265560 08-06 01:38
    2

    中断,让它跳过就好了。

  • lotfree 08-06 01:38
    3

    正常的, 必须起码80%的token消耗在各种测试

  • lukejr 楼主 08-06 01:41
    4

    @lotfree #3

    我觉得没意义,既然它喜欢测试,我现在已经用 gemini flash 快速推进,然后让它慢慢测试了

  • KEVI 08-06 01:41
    5

    必须要增加覆盖率

  • lukejr 楼主 08-06 01:42
    6

    真 tm 的巨慢,gemini 开发了 10 个功能了它还在那测试

  • lotfree 08-06 01:43
    7

    @lukejr #4 保证代码质量还是必不可少的, 到时候发现技术栈累成shi山, 编译都过不了, 就晚了

  • astom 08-06 01:43
    8

    挂着去打会游戏 ^-^

  • lukejr 楼主 08-06 01:44
    9

    @lotfree #7

    codex 写的才是屎山,全部都是手搓,我今天让 gemini 和 grok 检查了一遍,项目里新增的很多都是有开源组件可以替代的。

    手搓正则,手搓 pq connection,都不知道它哪里来的自信。

  • lukejr 楼主 08-06 01:46
    10

    @lotfree #7

    而且我把检查的开源替代结果发给codex 检查,它还以新增依赖和 repo 的 node 版本不兼容来反驳。

    我问了一句 repo 的 node 是不是该升级了,它说是。

    整个一个大聪明。

  • lukejr 楼主 08-06 01:49
    11

    一想到我 pro20 的大部分 usage 都被这些低级低质的手搓代码和它的关联测试给消耗掉我就觉得 codex 还得再给 10 次 reset

    气疯了!

  • limit09 08-06 01:55
    12

    dd

  • corecore 08-06 09:22
    13

    用那个模型

  • meteoraf2hig 08-06 09:23
    14

    gemini也差不多,用它来写前端代码,调接口取后端的接口返回,它在里面写各种防御性取字段的代码,但是我明明是直接告诉它后端实际返回的结构是怎样的。

  • lukejr 楼主 08-06 09:35
    15

    @corecore #13 当然是无比先进的sol max or ultra

  • lukejr 楼主 08-06 09:37
    16

    @meteoraf2hig #14 但它快 不会反复测试。

    gemini的问题是小毛病多,但是快。

    sol不解决慢点问题真的用不下去了 grok4.5还需要多用才有结论

  • corecore 08-06 09:38
    17

    @lukejr #15 是不是调太高了,降低h试试

  • lukejr 楼主 08-06 09:40
    18

    @corecore #17 试了 medium 体验差不多。medium就是比max出小问题多了 但是测试依然多。

  • 江郎才尽 08-06 09:40
    19

    sol就是这样的,思考等级越高越这样 指定范围进行限制让它干才会好点 我有次就让它帮我写个插件 它看我浏览器打开了wp网站 直接进我网站开始上传安装插件了 真草了 那以后就明确让它只能干什么不能干什么了

  • lukejr 楼主 08-06 09:46
    20

    @江郎才尽 #19 有时候想想真不如gemini傻快点 有问题快点修 sol在那虚空防御 而且防御的时候特别爱手搓,我是真的无语死了

  • yuzuki-zzZ 08-06 09:51
    21

    tdd其实是现在对于ai来说最友好的开发方式了。

    因为开发的大头已经从编码变成code review了

    如果自动化测试做得好,很多时候也就不用逐行review了,这是趋势。

    当然如果不想让他做,添加agent.md或者skill禁掉就好了。

  • MaoWuLiu 08-06 09:54
    22

    Agents.md告诉他不写测试就是了,gpt还是很遵循指令的

  • 林地雪原-0062 08-06 10:05
    23

    不用 skill 就手搓多.要用的话可以把开源组件扔给 gpt,自己创建 skill,这样他才会用.

    而且 Claude 和 gpt 都有类似的问题,喜欢搞手搓.

    另外 Gemini 烂死了,基本上全是幻觉,写的代码基本不可用.

    codex 手搓至少能跑


    @lukejr #9

  • ccviolett 08-06 10:10
    24

    当我用 sol mid 做一个简单任务都能烧 10 分钟的时候,我就知道额度是怎么被偷走的了


    后面基本上就用 sol off 了,别让他想太多就能够干得好一些,但是这样的话感觉又很脱裤子放屁……那我为啥不用 ds

  • lukejr 楼主 08-06 10:11
    25

    @ccviolett #24 很对

  • lukejr 楼主 08-06 11:05
    26

    @林地雪原-0062 #23 gemini 一样的提示词给他,gpt 审查,算是比较好的方式了。不会很痛苦的等 test

  • TonyJonson 08-06 11:06
    27

    之前开了5.6 sol ultral ,跑了我2.5个周额度 4个多小时。最后我受不了,发了一句,严禁执行不必要的测试,过了一会才结束任务~~

  • tobt 08-06 11:07
    28

    测试 校验 回归

    屁大点功能都要套一边 ^-^

  • 老衲推车 08-06 11:07
    29

    PUA他

  • lukejr 楼主 08-06 11:08
    30

    真的挺痛苦的,之前 5.5 好不容易调教到比较舒服的 coding 路径,基模一变要从头来一遍。

  • 林地雪原-0062 08-06 11:09
    31

    @lukejr #26

    直接 codex 不写测试 + skill用组件,代码质量肯定比 Gemini 写了之后再改高...

  • lukejr 楼主 08-06 11:10
    32

    @林地雪原-0062 #31 也行。有什么好用的 skill吗。我让 codex 写的 skill 它自己都常常不走的

  • http401 08-06 11:40
    33

    给他掐断 然后提示词里写 禁止写测试

  • Kit 08-06 11:43
    34

    5.6版本真是过度谨慎,过度设计,过度防御,过度吞token

* 帖子来源NodeSeek
返回