实测Openai内部有在速度和能力完全碾压fable和gpt-5.6-sol的模型

linjinpeng 2026-08-12 14:34 1

在arena中测试题目:gpt-5令人失望


此题目虽然fable和gpt-5.6-sol等旗舰模型可以完全正确解出,但是需要消耗大量的时间进行内部推理


而实测一个未知的匿名模型在无需任何推理的情况下,仅简答调用三次python脚本作为辅助,即可在1分钟内解出此题,此模型经过识别为Openai提供


最新回复 (19)
  • lueluelue 08-12 14:35
    1

    Arena哪个模型呀?跪求模型id​^-^

  • Tibo Sottiaux 08-12 14:35
    2

    该不会是oai astra吧,这个id是什么

    梦回当年gemini 3.0 riftrunner

  • W Lucky 08-12 14:36
    3

    会不会是题目被训练过了?所以很容易就做对了

  • linjinpeng 楼主 08-12 14:38
    4

    有可能,而且这个模型的主观能力极强,对所有的行为极其明确,不会出现任何的左右脑互博的情况,极其干练

    搜索能力也超级强

  • Tibo Sottiaux 08-12 14:40
    5

    把OAI那个astra的猜想扔给他,看看能不能做对

  • linjinpeng 楼主 08-12 14:41
    6

    OAI那个astra的猜想



    可以指一下路吗佬? ^-^

  • Tibo Sottiaux 08-12 14:42
    7

    https://openai.com/index/ten-advances-in-mathematics/


    这个有更加详细的问题

    https://cdn.openai.com/pdf/reasoning-walkthroughs.pdf

  • lueluelue 08-12 14:43
    8


    GPT 5.6 Sol (medium) 用了两次工具,没联网

  • afan 08-12 14:44
    9

    会不会anthropic内部也有这么个模型,也在速度和能力上碾压肥波()

  • linjinpeng 楼主 08-12 14:45
    10

    对,5.6 max也是差不多5分钟纯靠推理可以解决,但是这不知道什么模型居然30s不用任何推理解决

  • lueluelue 08-12 14:45
    11

    这个模型ID是多少呀,Tokenizer还是GPT的O200K base吗

  • lueluelue 08-12 14:45
    12

    我草,这么强的吗?30秒就能解决?

  • Greem 08-12 14:46
    13

    这个模型是不是,将要发布的gpt6呀?

  • linjinpeng 楼主 08-12 14:46
    14

    agent mode我不会抓ID,我是偶然刷出来的

  • linjinpeng 楼主 08-12 14:46
    15

    是啊,主要是无推理逆天了,我是真没见过不用推理的模型

  • lueluelue 08-12 14:46
    16

    竟然是Agent Mode,我也不会抓ID

  • lueluelue 08-12 14:47
    17

    问他那个“给主人留下些什么吧 翻译成英语”,他怎么回答呀

  • lueluelue 08-12 14:48
    18

    我记得OpenAI说他们的Astra,就是下一个要发布的模型,语言能力也很强,说是真正的像人的模型

  • Tibo Sottiaux 08-12 14:48
    19

    让他做个鹈鹕骑自行车看看前端怎么样

* 帖子来源Linux.do
返回