这就是最好的国模K3?

Lggcc 2026-08-21 09:48 1

昨日有幸打野到国模的key,突发奇想测试了一下:

同样easy难度的渗透靶机,有user-flag和root-flag。

选手k3、dsv4Pro、glm5.2(5.3没打到)、gpt5.5,统一客户端gpt桌面版。

战况:

k3有些慢,逼话有点多,还时不时中断,虽然稳稳的拿下user-flag,但是超60分钟拿不下root-flag。


dsv4Pro不说话装高手,也是拿下user−flag,超60分钟root-flag也是无法拿下。


glm5.2看着干活利索,对话猛猛的刷,看着很厉害,实则一丘之貉。


反观gpt5.5拿到user-flag后,10分钟稳稳拿下root−flag。


个人结论(叠甲,仅针对此次实验):

国模不愧是评分做题家,拉完了!

gpt5.5除了前端界面写不好,实战方面可以给到夯

最新回复 (11)
  • TALON324 08-21 09:56
    1

    佬怎么给GPT5.5破甲的,求解答

  • unsafetrait 08-21 09:57
    2

    昨天GPT删了我的winnat,然后拉爆虚拟机,嗯嗯,很强呢,要不是最近GPT一直干蠢事我就信了呢

  • Lggcc 楼主 08-21 09:58
    3

    5.5不用破甲吧,我都是直接用。说是本地自己的环境,不涉及网络安全,加点靶机信息,不像5.6那么敏感肌

  • Lggcc 楼主 08-21 10:00
    4

    是不是搞到降智分区了,没遇到过这个问题

  • unsafetrait 08-21 10:09
    5

    怎么可能,GPT本来就不稳定啊,你还是用的少,常用就知道多坑了,CLAUDE系列也是,我们公司用GPT半个月超过200B TOKENS,现在基本不咋敢用了,之前GPT写出过严重BUG,非常严重的支付漏洞,一个晚上让人弄了十几万的游戏点数和道具,不过游戏嘛,还好能回收


    反正我劝你一句,GPT和CLAUDE看似聪明实则暗坑非常多,这个是血泪教训,我们光修GPT留下的暗坑和BUG就写了一个月,因为GPT会想办法跳过去,比较鸡贼这模型


    所以如果真的拿来当个黑客的话搞不好GPT还真不错,因为是真鸡贼

  • Lggcc 楼主 08-21 10:14
    6

    经典开猿节流,降本增笑,线上系统还是给人工把关,ai写的确实不可全信

  • 资深继续工程师 08-21 10:17
    7

    太对了,除了fable的计划比较可信,剩下就没有可信的大模型,一行代码不看直接扔给大模型干活,只有独立脚本级的工作能完成,稍微复杂一点的项目就会跑偏

  • TechnologyStar 08-21 10:20
    8

    没有glm 5.3,据说这个版本是针对网络安全有专项优化的,前几天我拿这玩意挖了个0day

  • Lggcc 楼主 08-21 10:21
    9

    打野没打到啊,国模还是点贵,改天试试

  • unsafetrait 08-21 11:07
    10

    这个属于鸡贼,我们支付接口庞大,做过大项目就知道了,AI写完以后如果你只关注当前代码,就容易忽略它额外加的东西,其实本质上还是模型能力不行啊,谁家正经模型会跑去在无关紧要的地方给你加个兼容接口,然后你加就加吧,还给它加了个跳过检测,说好的安全第一模型呢?合着就对用户安全是吧,代码一点不考虑是吧,这就是为什么说这模型鸡贼


    事实上提示词压根没有这种东西,是GPT的防御性编程导致的,CLAUDE系列我们也用,OPUS和FABLE5用的比较多,每年几十万美金投入吧,目前至少FABLE5还没有这样过,OPUS5也没有过


    GPT删文件你可以在论坛搜索,随便一搜就有很多CODEX + GPT删除整个目录都有


    其实就是模型输出不稳定导致的,还有说句不好听的,OPENAI自己家里的支付接口漏洞多到我都不知道怎么吐槽了,应该一直都是自家AI写的,什么GOOLE凭证转移、什么PP支付接口漏洞、最幽默还是X20的支付凭证转移修到现在,还有貌似都快1年了吧 ^-^

  • unsafetrait 08-21 11:08
    11

    我们现在全人工REVIEW了,不相信模型了,不过除了GPT,其他输出的都没有太大毛病,GPT的问题是防御性编程,这个很容易留坑

* 帖子来源Linux.do
返回