Astra 在
- 漏洞识别、
- exploit development
- token efficiency
上均有显著提升
过去,
GPT-Sol在意图理解上差强人意,常会遇到Agentic属性大爆发一口气把错误做大做强;而这次官方称 Astra 比 GPT-5.6 Sol 更能遵守明确的安全与权限范围,是 OpenAI “most aligned model to date”。
这个问题确实显著,
在过去的两个月里,我高强度使用Sol Ultra/Max ; 作为我的 CodingModel,Sol 时常会补足 Plan 规定外的实现,甚至直接补出大半个我不需要的功能或页面,前端设计信息密度过高,有很多的无效填充。
而它对逻辑的思考和鲁棒却并不能起到作用,反而会误判导致任务失败,且错误归因。
当时正在写调用Deepseek的Agent,而Sol在多次日志分析和BrowserUse中拒绝面对模型超时问题,Http 请求提前中断导致任务失败,它不以为然,甚至增设多个超时兜底机制,而不考虑直接延长超时限制。一是它不懂问题的核心,二是保守的思想钢印让他放不开手脚,但矛盾的是在错误的思考上它总能大步向前,可以说是缺少了宏观的视角、分析和判断。
这样的体验显然是说不过去的。Sol在简单任务,清晰指引下有着不错的发挥,这一次看来OpenAI是想更进一步,把 Astra 打造成一个非常强的工程 Agent,祝他好运。
相比于一个只会写代码的人工智障,我更期待的是Astra能拿出Claude那样细腻的模型,在文学、审美、人物理解、微妙情绪、长篇一致性上取得一定的突破,都说AI擅长文字领域,但Sol目前在小说上我认为表现完全不够看;
它不懂留白,只是一味润色。
我平时很喜欢用大模型续写自己的小说。
可以说是打电动以外最让人兴奋的事情了。
从 ChatGPT、Gemini、Grok、Deepseek、Claude 我都有试过,我个人也更依赖这个项目来判断模型能力,他能检查模型大海捞针、上下文压缩、用户意图理解、以及深层思考的能力和模型功底。
游戏的规则很简单,
我有一份 超长的上下文,给到模型,
我给出剧情概要,模型延展出正文。
在中间我会故意留出悬念和伏笔,Claude 可以精准识别出其中预埋的细节,他对上下文的掌握可以说炉火纯青,总能在你想要时给到满意的答案。Claude 懂得语言的轻重,详略得当,深刻的情绪是通过喘息的空白流露的,而不是一堆辞藻的堆砌;Gemini 在遣词造句上值得表扬,他的语言很美,但如果只是说漂亮话,内容并没有什么引力,有差异有跌宕起伏的文字才能扣人心弦。你可以用Claude 搭好这个骨架再交由 Gemini 润色,相信我,一定满意!
但是GPT-Sol Max做的并不好,他没办法理解到用户深层的想法,情绪是有意象的,意象会勾勒出回忆,但Sol 看山是山,看水也只是水,他不明白为什么眼泪需要空间,为什么伤感需要独处,他只知道大篇幅的润色在训练里就会得到奖励。
现在Claude封号很厉害,我已经很久没写了东西了,
Sol 给不了人惊喜,给不了我憧憬。
但我希望Astra能做到,
很快就会揭晓答案