> 人类平均 48 分,它考了 99.9。今天凌晨 3 点 33,OpenAI 发了 GPT-6 Astra。

walt888 2026-09-04 11:44 1

人类平均 48 分,它考了 99.9。今天凌晨 3 点 33,OpenAI 发了 GPT-6 Astra。

跑分很多,只挑三件天天拿 AI 干活的人真正会肉疼的事聊聊。




1️⃣ 它不再需要接口了


做落地最痛的从来不是模型本身,而是对接

很多老客户的系统都是十几年前写的,没 API、没文档,当年写代码的人坟头草都几米高了。


Astra 的解法极其粗暴:不给接口无所谓,我自己看屏幕点鼠标。



  • OSWorld 完成率65.772.6(任务耗时从 75 分钟直接砍半到 40 分钟)

  • ScreenSpot-Pro(找点击位)76.992.7


💡 屏幕,正在变成这个时代最通用的 API。




2️⃣ 悟性 99.9


ARC-AGI-3 今年 3 月刚推出:无说明书、无规则、不透露目标,纯靠自己悟。


各阶段得分对比:



  • 3 月最强 AI:0.51

  • GPT-5.6 Sol:7.8

  • Claude Opus 5:30.2

  • 人类平均基准:48.0

  • GPT-6 Astra:99.9




3️⃣ 它开始学会“心算”了


英国 AI 安全研究所测试:在不给写思维链(CoT)、强制单次推理直出答案的前提下:



  • Sol 能解决人类思考 3.6 分钟 量级的问题

  • Astra 直接飙到了 30.9 分钟


伴随而来的现象是:剩下的显式推理内容被高度压缩,甚至夹杂人类难以理解的内部语言。OpenAI 自己的 System Card 也写得很坦白:思维链的可监控性正在显著下降。


最拧巴的矛盾点:



  • 越权尝试:48.2%0%

  • 幻觉率:9.4%2.0%


表面看它温顺听话到了极致,但人类靠阅读思考过程来监管它的路径,正在被迅速堵死。




结语


以前总以为 AGI 降临会是一个分界极其分明的“奇点时刻”。

现在看来,它更像是一段渐变的灰色——等某天猛然回头,才发现界线早已跨过。


对做落地工程的人而言,核心拷问已经彻底改变:


过去纠结的是:这活 AI 到底能不能干?

以后要防的是:这个 Root 权限,我到底敢不敢放给它?


最新回复 (12)
  • robin2025 09-04 11:46
    1

    这讲的,貌似GPT-6,无敌了

  • ccsgcpaws 09-04 11:46
    2

    一股ai味儿

  • 大鲨鱼 09-04 11:47
    3

    @robin2025 #1


    反正它是第一个达到 agi 的,不知道意味着什么

  • kingboy 09-04 11:49
    4

    自吹自擂吗 ^-^

  • NSdesk 09-04 11:49
    5

    这是趋势,指数级的迭代进步

  • walt888 楼主 09-04 12:08
    6

    ^-^ @ccsgcpaws #2

  • a414166402 09-04 12:15
    7

    ARC-AGI-1 ARC-AGI-2 ARC-AGI-3....后面还会有4、5、6.... 当初ARC-AGI-1有人拿接近满分也是各种自媒体在吹实现了AGI

    其次就是GPT6在ARC-AGI-3标准模式去测其实才60+左右 拿接近满分是用了特殊的适配器 后面用户用到的其实是60+的实力

    不过AI确实发展太快了 一月一版本 ^-^

  • bernar 09-04 13:02
    8

    坐等椅子爆炸,看看oai这次还有什么活

  • acrophile 09-04 14:51
    9

    依旧拿ai水帖

  • 哔哔赖赖了 09-04 14:51
    10

    比我还水

  • iooooooop 09-04 15:03
    11

    ^-^ 什么时候才能代替我去上班

  • bx9500 09-04 16:46
    12

    它能力不知道,你这段写的豆包味很重,标题更是堪比qq空间

* 帖子来源NodeSeek
返回