Codex 雷达上线一段时间了,做个月度复盘

LDa 2026-08-12 16:09 1


这本来是七月份的复盘,忙忙碌碌拖到今天,不过正好分布式雷达上线也快一个月了,也算一个月度复盘吧



毛两个月前,站长做了个 tibo 重置预告,针对 tibo 的推特进行分析来判断重置概率,在运行一段时间后我们发现大家在讨论重置之余,也总是诟病模型降智问题,因此我们一拍即合做了 codex 智商监测。


最早的时候,我们拿了现成的 SWE 评测标准,几个人凑了点号在后台每天运行测算模型 IQ ,得到一些基准数据并发布到网站上,没想到一经发布流量就爆了,原来也有很多小伙伴跟我们一样,对着经常货不对版的模型光烧 token 却得不到想要的结果。


再次运作一段时间后,蹬友们开始不满足于每日一出的 IQ 报告,我们增加了评测频率,希望能提供更有时效性的 IQ 指标。其实中途也有热心的中转大哥想支援我们一些 token ,但由于担心中转的模型不能直观有效地反应 oai 模型质量,我们商讨之后还是拒绝了,依然使用几个 20x 账号进行评测。


再再后来,我们的钱包实在撑不住了(服务器、流量、订阅等综合成本实在是高昂),为了分摊一些成本,我们不再增加订阅账号,而是新做了一个分布式雷达站点,让蹬友们可以把多余的 token 贡献到具体的题目上,为 IQ 测算出一份里,也能增加智商监测的实时性。


以上是两个站点的由来(其实还有一个 claude 智商监测站,但是 A\ 把我们手上的 max 号全封完了,遂暂停!(口吐芬芳))


一路走来,感受到在工作之余为别人解决一些真切问题的谢意,互联网上的真诚感谢比真金还贵重,在此也感谢大家的心意支持和 token 支持。


===============================


接下来汇报一下进展和未来要做的事情


月活量已经做到了 40w (分布式站)
yuehuo


收到网上热心大哥们的热心助力共计 12 万刀
kanban
为了感谢大哥们的支持,我特地制作了 3D 打印奖杯作为答谢
jiangbei


未来针对 SWE 基准和实际工程应用的体感偏差,我们正在抓紧商讨设计新的测试集,在这里要特别感谢 boyang-hu 的前端网站复刻相关帖子和 skill 在友好交流后,我们在想办法把他的成果固化成测试题,解决了前端工程能力测试难以度量的痛点。接下来我们希望我们能做出更贴合实际体感的测试结果,减少高分低能的情况出现。


最后,衷心祝愿大家永不封号,永不降智,开心地蹬!

最新回复 (32)
  • momomoo 08-12 16:28
    1
    感谢做了这么好的网站,每天都在用。
  • An007 08-12 16:31
    2
    感谢,天天都有在用。
  • LDa 楼主 08-12 16:37
    3
    @momomoo
    @An007 谢谢支持 我们会再接再厉的
  • FByron 08-12 16:55
    4
    感谢 每天用 codex 前先看网站数据
  • Felldeadbird 08-12 16:57
    5
    感谢大佬的开发。雷达站确实好用。
  • tuangouzi 08-12 17:07
    6
    求个入口
  • LDa 楼主 08-12 17:08
    7
    @tuangouzi https://codexradar.com/
  • Yishanshan 08-12 17:10
    8
    看来你真是来感谢的,连个入口都不放
  • neway 08-12 17:15
    9
    google codex 雷达就能找到,别只伸手要 https://codexradar.com/
  • LDa 楼主 08-12 17:18
    10
    @Yishanshan 哈哈哈,真切朴实的感谢
  • msg7086 08-12 17:55
    11
    之前就推荐给公司里的同事了。
  • LDa 楼主 08-12 17:59
    12
    @msg7086 感谢推荐
  • yming 08-12 18:59
    13
    支持,太棒了
  • ktyang 08-12 19:09
    14
    我提一个意见啊,目前的侧重是代码实现,可能和智商还是不能完全划等号的,很多时候真实应用的时候的体感跟网站上算出来的得分差异很大,luna max 和 xhigh 非常明显。
  • EvanClausen 08-12 19:35
    15
    上个月朋友分享了这个网站,很有意思哈哈哈,每天闲的时候都会打开看看 Tibo 是不是又要开始妖或者模型有没有降智,感谢大佬
  • LDa 楼主 08-12 19:52
    16
    @ktyang 这个意见非常中肯,其实我们也看了非常多的基准测试,但是日常使用评测的验收判断非常困难,暂时还没想到有啥好办法,所以大部分的评测还是围绕这可定义可验收的编程环节来的。不过最近上线的庞贝副本利用拼图测试对模型的视觉理解能力能一定程度进行评测,欢迎来玩
    https://deng.codexradar.com/?benchmark=pompeii-adjacency
  • grindmule 08-12 19:52
    17
    确实很优秀哈
  • LDa 楼主 08-12 19:54
    18
    @Felldeadbird
    @msg7086
    @yming
    @EvanClausen
    @grindmule 感谢大家的支持鼓励 谢谢
  • JasperHale 08-12 20:03
    19
    恭喜月活新高!
  • ktyang 08-12 20:28
    20
    @LDa #16 嗯嗯 我也理解这个问题是很困难的,需要好好思考,后面有精力了我也可以把我的思考跟你们交流一下。测试视觉理解能力建议统计一下网络流量的消耗,我之前搞图片相关的任务的时候流量耗的飞起。
  • LDa 楼主 08-12 20:31
    21
    @ktyang 现在流量费用很高 期待跟大佬交流
  • zlo309618100727 08-12 22:02
    22
    大佬,请问能力测试集公开吗?
  • LDa 楼主 08-12 22:08
    23
    @zlo309618100727 现在用的测试能力集就是公开的 DeepSWE
  • menghuitangchao 08-13 00:52
    24
    恭喜,我之前还是经常用的,但是后来受不了研判结论时的 AI 味很长时间没打开了
  • LDa 楼主 08-13 01:21
    25
    @menghuitangchao 请问研判结论具体指哪块?我们回头看看
  • HXM 08-13 08:58
    26
    天天在用的网站,支持
  • ltfree 08-13 09:54
    27
    第一次访问,没看懂这网站是干嘛的?除了预测还有其他功能吧
  • LDa 楼主 08-13 10:13
    28
    @ltfree 核心功能就两个 1.预测重置时间 2.监测模型降智情况
  • IanHo 08-13 10:41
    29
    支持
  • menghuitangchao 08-13 11:32
    30
    @LDa #25 找到一张上个月初的老图,现在好像改版了
  • e6f6d627f646 08-13 11:56
    31
    tql, da 子哥, 雷达站贼好用.
    claude 什么时候上?
  • wzw 08-13 12:13
    32
    @LDa #28 模型评分, 你自己测的吗? Luna Max 那么高分+便宜, 可以顶 Sol high 了
* 帖子来源V2EX
返回