一个暴论:未来最有效的Benchmark,其实是一句话 prompt

StarFox 2026-08-08 18:38 1

有一个想法,很想提出一句暴论:未来真正能够校验 AI intelligence 和 agentic 能力的 benchmark,最应该是一句话 prompts


看到了 OpenAI 最近对于其 Astra 内部模型做数学题的论文,主要就是说 Astra 模型已经能够解决很有含金量的数学问题。


这当然是宣传上的事实,但实际上不可否认,Astra 模型在内部确实有助力,但更多的其实是靠数学家和数学从业者提供十分精确的 prompt 作为引路方向。这也就是说,如果按照严格的“AI 独立解决”来衡量,这其实不算。毕竟理想中的 AI 独立解决,应该是我们直接告诉 AI 去解决某个数学问题,然后 AI 自己想办法、自己去做,总之最后能拿到解决问题的结果就行。


于是我就想,如果我们派给一个真正的人一项任务,理论上来说,我们不需要说很多,一句话告诉他任务目标,他就应该能完成。AI 是不是也是这个原理?


如果只用一句话想让 AI 解决一个数学问题:



  1. 首先,AI 需要先理解这句话。

  2. 理解完之后,它需要给自己设定目标。

  3. 设定目标后,它需要具备完善的思考能力与智力。

  4. 其次,它要能知道这句话中隐含的信息,做到代替原有的数学家在这一场景中所发挥的作用。


所以,这才真的是智能的体现。如果我们拿一句话 prompt 做跑分,那么根据一句话所能完成的任务能力越强,其实就越是 AI 综合能力的一种体现。


当然,这是个人的一些猜想,接受各位佬的指正

仅做讨论

最新回复 (15)
  • neteroster 08-08 18:42
    1

    问题在于很多时候「一句话」是不适定的。


    你无法仅仅通过一句话就将LLM和你的需求对齐,除非你的需求真的就是这么简单。


    软件工程这个大领域有一个子领域叫做需求工程(requirements engineering),整个这个子领域这么多年就是在研究如何收集需求,把需求整理为合适的软件设计、表达,并且高效的传递给实现者。


    逃避复杂性的结果就是面对更大复杂性的海啸。本质上关键还是在于如何设计更好的人机交互流程,使得需求对齐更加轻松,例如/grill-me就是其中有意义的一次尝试,未来将需求对齐技术结合进入 LLM 训练也是一个很有前景的方向。

  • 诡道疯人 08-08 18:43
    2

    主要问题还是 每个人的想法都不一样 如果你要一句话prompt的话 有可能会出现它做的很好 但是和你的想法不一致导致你觉得不行

  • 白濑 08-08 18:43
    3

    其实在看到之前的模型,有一部分从普通模型转到思考模型,他们的思维链第1句是思考用户当前请求。的内涵,比如deepseek,他们首先会思考用户的请求,用户打错字的时候,他们会概率进行纠正

  • mango 08-08 18:43
    4

    /grill-me

    我很懒,所以需要 ai 主动点

  • yu oimo 08-08 18:44
    5

    能把提到的prompt不漏不缺稳稳的接住我就不错了,一句话跟许愿没区别

  • StarFox 楼主 08-08 18:45
    6

    确实是,好多的任务它并不是说一句就能够完成的,比如说很多生产力上的办公任务。


    但我更想说的是一些比较有浓缩性和目标性的任务。这些任务好多时候过多的 prompts,其实本质上就是为 AI 的行为以及它的思考提供引导。


    只有当 prompts 浓缩在只表达任务目标的时候,AI 还能够准确地完成任务,这就说明 AI 它的思考能力已经接近于人类了,甚至说是已经能超越人类了

  • Tibo Sottiaux 08-08 18:48
    7

    一句话很多都是看运气,像抽卡一样。有一次我用5.6sol测试skill时候做了5版同一网站,质量差异很大

  • StarFox 楼主 08-08 18:49
    8

    说实话,我倒是不认为接下来 AI 的发展在稳步执行一套详细的 plan 下面有什么很大的问题。毕竟照这个发展速度,到最后 AI 能够完美、近乎不出错地精确完成一套 plan 几乎是必然的。


    但是,真正能够对科研和一些学术性问题,以及开创性、或者说是想象性的事物做出突破的,肯定还是要依靠 AI 自身的发散性思考,以及它自身思考的能力

  • 九翅金乌 08-08 18:50
    9

    我连我自己到底想要什么效果都不清楚。。。

  • StarFox 楼主 08-08 18:50
    10

    其实模型不同,生成会有不同的结果是不奇怪的。我个人认为,只要后续能达到目标就行。


    至于细节上的质量差异,我觉得更多是个人的感受所致,这个就需要后期的 prompt 微调了,但至少大体目标是达到的

  • qilme 08-08 19:09
    11

    这说的看起来就像是AGI吧,说一句话就能实现愿望的许愿机。现在确实是这么个趋势,像是A/的agent提示词越来越少

  • Enze 08-08 19:10
    12

    大模型这个概率系统追求的是确定性,不是更加随机,用户“许愿”体验的提升,并不应该主导专业评分(也无法实现)

  • LucentSnow 08-08 19:21
    13

    最难的就是判断一句话所产生的结果的优劣了吧,问题在于,比如说,我让AI解决某个数学问题,实际上只有两种结果,解决了,没有解决。我当然能说解决了的AI比没有解决的强,但是假如都解决了,或者说假如都没有解决,那怎么区分强弱呢。没法打分啊

  • ydream 08-08 19:23
    14

    /goal 帮我赚1亿美元。类似这种是吧 ^-^

  • lulinkjason 08-08 19:58
    15

    说得有道理。但这一句话一定要是需求清晰、逻辑清楚的一句话,否则变量太多,不足以当做测试。

* 帖子来源Linux.do
返回