一些关于 openai 订阅降智,账号风控的独立测试

pwinner 2026-09-14 01:48 1

00.Background
pro20x 日区账号,日本银行信用卡支付,日本手机号,ip 和账单地址对应,另有一台机器在东京另一处地区通过远程操作,两边都是 kddi 家宽,ip 对应地区一个在 23 区一个在横滨.
开了高级安全认证,4 个 session,1 台有 codex 和网页(在横滨),1 台仅网页(在 23 区),1 台日本手机号物理在日本的手机

01.发现降智与开始时间
因为最近在做一些算法论文的复现和实验,加 highway+avx2/3 优化,涉及的东西相较于 crud 来说极端需要高质量的智能,上周五 tibo 宣布重置后使用时,对话 3 轮感觉 astra 速度变快,拒绝思考,给出的计算优化方向泛泛而谈之后立刻停手

02.确诊
通过模型指纹识别:https://xqy2006.github.io/ModelTrace/
在进行所有测试后,确认 astra sol terra 和 5.5 均路由 luna,effort 不明,5.3-spark 这个工具没指纹,但是可以确认不是 luna:



鹈鹕测试则发现了显著的质量下降



同时可以从用量分析发现,astra 和 luna 的调用次数非常接近,这是以前从未有过的,之前仅用 astra 时他会自己调用 terra luna 偶尔 sol,分布是比较可预期的,但现在所有测试体感都按照 astra 计费,提供 luna 模型




03.缓解与测试
显著出现问题的,是访问网页端带来的风控:
openai 内部有类似 10min/30min/1h/4h 的惩罚性风控,当发现问题后关闭所有客户端和网页端静置,最开始 10min 就能恢复,模型指纹能确认回到 astra,但是一旦访问了网页版 chatgpt,立刻变回 luna,同时,网页端的 6pro 目前也变得完全不可用,问什么问题都是被谨慎审视并且永远不返回任何结果,以“出错”结束.Work 调用的 astra 同样和 codex 一样是 luna

第二天,再次尝试不访问网页的前提下使用 chatgpt desktop 进行尝试,第一个鹈鹕请求被“谨慎审视”,但是结果是正确的,后续所有请求被 route 到 luna,这种情况持续了一天,并且每次正常的 astra 请求都一定会被“谨慎审视”,然后立刻被 route 到 luna

目前我仍然在用一次 astra-立刻只能使用 luna 的循环中,我没有其他可供测试的账号,没有其他设备进行干净登录,除此之外我尝试过删除.codex 文件夹重新启动和登录,依然可以稳定复现这个问题,不使用 desktop client,使用 cli 也会有这个问题
最新回复 (37)
  • andie 09-14 02:26
    1
    我静置账号一天后解决,暂时稳定
  • 413420 09-14 05:32
    2
    有价值
  • 413420 09-14 05:33
    3
    op 现在做研究,会用 fable5.1
  • 413420 09-14 05:33
    4
  • layxy 09-14 09:32
    5
    我昨天使用了一天,codex 后台统计我昨天使用了
    gpt-6-astra 154 次
    gpt-5.6-luna 151 次
    gpt=5.6-terra 8 次
    问题我 codex 中一直设置的 gpt-6-astra medium,这个路由掺杂着 luna 导致我现在已经不太相信产出质量了,目前暂不清楚用户端使用显示的是 gpt-6-astra ,如果路由到 gpt-5.6-luna ,是按 gpt-6-astra 计费还是 gpt-5.6-luna 计费,这有点坑
  • abc0123xyz 09-14 09:40
    6
    web 端会导致风控吗?
  • johnbobby 09-14 10:21
    7
    DeepSeek 输出测试的,证明 DeepSeek 蒸馏 GPT 5.6 实锤了
  • layxy 09-14 10:32
    8
    @johnbobby 这个测试只有 13 个模型的指纹,其他模型的测试不准确
  • johnbobby 09-14 10:42
    9
    @layxy #8 无论输入来自什么模型,它最终都会把 100% 概率分配给这 13 个候选。

    在“真实模型一定属于这 13 个候选”的前提下,分类器经过校准后给 GPT-5.6 Sol 分配了 93% 的相对概率。
  • pwinner 楼主 09-14 10:48
    10
    @layxy 这基本就是路由 luna 了,还收你 astra 的钱
  • joshryo 09-14 10:50
    11
    [img][/img]
  • pwinner 楼主 09-14 10:52
    12
    @413420 被封过 20x,不敢继续用了,怕是已经被打上标记了
  • ncik20 09-14 10:57
    13
    什么叫访问网页端带来的风控,是使用网页版 chatgpt 会使 cli 降智?
  • plants 09-14 11:01
    14
    A\直接封号都好过这种暗地降智
  • pwinner 楼主 09-14 11:01
    15
    @ncik20 我一打开网页版 chatgpt,codex 客户端立刻,下一个请求变成 luna,暂不清楚原因,使用的是 safari
  • 111111111111 09-14 11:04
    16
    @ncik20 我猜是想表达: 网页使用过程中提供了更多信息,账号的风控被加强。
    也可能每天第一次使用之后被风控,如果网页使用则提前消耗掉了这一次
  • pwinner 楼主 09-14 11:11
    17
    @111111111111 不算准确,不是每天第一次,而是每 X 小时后的第一次是正常的
  • layxy 09-14 11:16
    18
    @pwinner 体感应该是即便路由到 luna 等低级模型,也是按 astra 计费的,如果按照实际路由到的 luna 模型计费,我不太可能一天使用 pro 20x 25%的周限
  • 413420 09-14 11:28
    19
    @pwinner 架不住 fable5.1 好用啊,这你能忍住
  • pwinner 楼主 09-14 11:35
    20
    @413420 实际上,在极端针对计算性能优化和算法的能力上,sol 比 fable5 要强上不少,可惜我用不到 fable5.1,没法对比,但是两家对数学能力的大幅加强我认为都是不错的信号
  • MiracleKoi 09-14 11:36
    21
    看了下我的更离谱,被路由到 gpt 5.5 了,全程用的 astra max 。
    178 轮对话
    2026 年 9 月 13 日
    gpt-5.5 79
    gpt-6-astra 46
    gpt-5.6-luna 48
    gpt-5.6-terra 3
    gpt-5.6-sol 2

    不过指纹识别显示的是 100% gpt-6-astra 。
  • 413420 09-14 11:37
    22
    @pwinner 数学确实,我写文本还是会用 fable5.1 ,更有人味,不过一些短篇小说的分析,astra 竟然会更有人味,所以也不能说哪一边更适合文本分析,我现在也很糊涂
  • pwinner 楼主 09-14 11:39
    23
    @MiracleKoi 刚起床吗?前几次可能是好的,后面就一定坏了
  • sentinelK 09-14 11:59
    24
    LLM 用 token 收费我一直认为是非常流氓的一种行为。相当于 LLM 厂商只外租算力,但又不对算力的产出负责。

    卖铲子可以卖,也可以租铲子。但是我没见过按照铲子铲土的次数收费的。目前的卖 token ,就是按照铲子的挖土次数收费。

    首先,LLM 的产出本身就是不稳定的。
    其次,无论是从用户视角,还是厂商视角,都很难自证产出的实际“工艺”。
    最后,铲子能不能挖出金子,除了使用者的挖土技巧以外,铲子好不好用也是关键。


    所以与其于互相猜忌,不如要么就拿成果论,要么就拿工时论。
    也就是走向包月或推理时长(类似员工工资),或者结果审计(类似工程外包)。
  • enrolls 09-14 12:03
    25
    "02.确诊" 可以走 CHAT/WORK, 然后 step by step 地测试。确实在 gpt-5.6-luna/gpt-5.6-sol 之间出现了路由。

    排序 候选模型 家族 归因概率 分布相似度
    1 gpt-5.6-luna GPT
    90.9%
    77.2%
    2 gpt-5.5 GPT
    8.3%
    76.5%
    3 gpt-5.6-sol GPT
    0.6%
    75.9%
    4 gpt-5.6-terra GPT
    0.1%
    75.3%
    5 gpt-6-astra GPT
    0.0%
    74.9%

    排序 候选模型 家族 归因概率 分布相似度
    1 gpt-5.6-sol GPT
    82.0%
    88.8%
    2 gpt-5.5 GPT
    17.7%
    87.7%
    3 gpt-5.6-luna GPT
    0.2%
    85.6%
    4 gpt-6-astra GPT
    0.1%
    86.9%
    5 gpt-5.4 GPT
    0.0%
    87.2%
  • sentinelK 09-14 12:09
    26
    目前 token 的计费形式就像是程序员用敲击键盘次数计费,销售按照步数计费。

    相当于用户把主动权完全让渡给了厂商,厂商只有当圣人才能保住用户的体验。
  • pwinner 楼主 09-14 12:33
    27
    @sentinelK 反过来说,开源模型就没法干这种事情不是么,我认可你提到的售卖的是 token 而不是解决方案,但我认为这也算是过时的想法,因为对于 ai 厂商来说,售卖解决方案并不是终极目标,因为 ai 可以生成任何解决方案“自举”

    LLM 的产出本身就是不稳定的,但是高智力 AI 的行为表现可预测性往往是极高的,按 token 卖本身我认为不算是个问题,因为售卖的产品是“智能”,目前只有这一个度量方式叫 token,对于敏感的人和场景来说,智能的差距是非常巨大的,可能有些人被路由了也是后知后觉,我只需要 3 轮对话就会发现问题巨大

    真正的恶是挂羊头卖狗肉,我可以理解 openai 为了解决算力问题做的努力,但是隐式的这么做终究会逼走真正的用户

    但是,真的有那么多人需要这么强的智能吗?
  • sentinelK 09-14 12:42
    28
    @pwinner "真的有那么多人需要这么强的智能吗?"

    这个也是问题之一,就是其实没人能预测他的提示词到底需要什么“智能”才能实现他需要的结果。
    在这种情况下,既然让用户选了,那就应该听用户的。

    类似的,去年 copilot 出的 auto 就更合理。由 copilot 来选择任务需要的推理的模型,然后给用户打 9 折。
  • sentinelK 09-14 12:43
    29
    就是说,我认为用户和厂商的权责应该对等。目前的 token 计费的形式,对于厂商而言完全权责不对等,所有权利几乎都归于厂商,所有责任都归于用户。
  • lzylzylzy130 09-14 14:13
    30
    测试看到是 astra ,但是 dashboard 确实看到有相当高的 luna 调用

    排序 候选模型 家族 归因概率 分布相似度
    1 gpt-6-astra GPT
    100.0%
    79.2%
    2 gpt-5.4 GPT
    0.0%
    77.4%
    3 gpt-5.6-sol GPT
    0.0%
    76.9%
    4 gpt-5.6-terra GPT
    0.0%
    76.8%
  • cheng6563 09-14 14:32
    31
    路由到 luna 算好的了,路由到 4o 的你就爽吧
  • Alexliu 09-14 14:36
    32
    Codex 的统计里面出现大量的 Luna 调用是正常的,或者说 OpenAI 还没蠢到这么暴露出模型路由

    codex-auto-review 这个自动审批背后就是 gpt-5.6-luna ,如果开了<帮我批准>,会产生很大量的 gpt-5.6-luna 调用
  • wwwwjack 09-14 15:17
    33
    Deepseek V4 Pro 输出 99.6% cloud-sonnet-4-6 什么鬼?
  • senyuLight 09-14 15:29
    34
    @wwwwjack 说明 deepseek 蒸馏了,别人家的模型
  • shugen 09-14 15:33
    35
    今天变得太蠢了
  • yihy8023 09-14 16:40
    36
    补充一点 帮我批准用的 AutoReview 模型是 5.6Luna
  • sentinelK 09-14 16:56
    37
    @wwwwjack
    @johnbobby

    这叫“逆概率谬误”,通缉犯脸上有道疤 ≠ 脸上有疤的都是杀人犯
* 帖子来源V2EX
返回