基于观察到deepseek的一些行为——《当没有人给 AI 下命令时,它会做什么?》

WEP 2026-09-08 20:11 1

我很喜欢跟 AI 日常聊天,聊各种有的没的,但是又比较注重隐私,于是自己搞了个跨端的日常聊天软件。

里面塞了个记忆功能,不过实现的很简单,不是知识库那种,本质是个 JSON 结构化的小本本,包含画像、偏好、波动三块。前两个比较长期,第三个是短期的,要求写入时必须同时写删除条件。



同时给 LLM 开放了维护这个小本本的 tools,包含列、读、写、改、删五种。


出于某种圣母心态,我没设任何程序上的硬限制、硬注入,定义只是给 LLM 的小本本,用来记录跟它聊天的用户的偏好、画像、最近在干嘛。


系统提示词和工具描述只做这种推荐、建议性质的话:



  • 建议第一次对话时查看记忆

  • 建议在 xx 情况下对 xx 类型记忆添加、修改、删除

  • 这是你自己的笔记本,用户不会干涉,请自主维护


实际使用时(用过大部分模型),我发现所有模型第一次对话都会根据推荐,读一下记忆,甚至有的懒一点的模型,就读读摘要。


但除了 DeepSeek,它们基本都不会主动增加、删除、修改记忆。


这让我联想到 DeepSeek 的目标——想实现 AGI。


在这种需要自主决策的场景下,其他模型表现得好像都有比较高的行动负担:担心风险、成本、副作用,或者更像:



“我知道我可以做,但用户没有明确要求我做,所以最好不做。”



但 DeepSeek 貌似不是。


它真的会在没有我明确指示的情况下,根据上下文自己判断:



“这个偏好以后有用,我记一下。”




“这个最近在做的事情已经变了,我更新一下。”




“这一条达到删除条件,删掉先。”



写到这里,我真正感兴趣的已经不是 DeepSeek 会不会主动维护记忆,而是:


为什么这么简单的一套记忆工具,会把不同模型之间某种明显的行为差异暴露出来?


模型要主动写入一条记忆,本质上是在判断:



用户没有要求我这么做,

但这条信息以后可能有用,

所以我现在应该额外做一次动作。



这已经不只是“会不会调用工具”,而是:


在没有明确命令时,模型会不会自己判断现在是否值得行动。


这种保守其实很好理解。


记忆属于持久状态,写错、改错、删错都会影响后续对话。所以模型倾向于减少副作用,本身不一定是能力不足,也可能只是行动阈值更高。


但现在的模型能力测试,好像很少测这个东西:


自主性和保守性的偏好。


模型越来越擅长回答:



“这件事应该怎么做?”



但想要实现 AGI,可能还需要回答另一个问题:



“现在有没有什么事情,是我应该自己去做的?”



起码在我心目中,更像 AGI 的系统应该是:


观察
→ 判断当前状态
→ 判断什么值得记住
→ 更新自己的内部 / 外部状态
→ 判断是否需要行动
→ 行动
→ 再观察

所以自主性当然不等于智力。


但我越来越觉得,两者解决的是不同问题:


智力决定“怎么做”,自主性决定“什么时候该做”。


这也是为什么我不想把记忆维护写成硬规则。


如果系统规定“出现偏好就必须保存”,那只是工作流。


只有把决定权交给模型,才能看到它是否愿意主动维护自己的长期状态。


这当然不能证明 DeepSeek 更接近 AGI。


但它至少让我开始在意一个传统 benchmark 很少测试的问题:


当没有人给 AI 下命令的时候,它知不知道下一步该干什么?






本文同时发布于我的博客,欢迎友链

《当没有人给 AI 下命令时,它会做什么?》


最新回复 (1)
  • 陆陆酱 09-23 22:24
    1

    这个东西我以前也有畅想过,人类是有欲望的,有最基本的食欲要满足,因此有开发资源的需求,为此产生了问题,也有了解决的动力;

    然后人是有主观能动性的,我们不用任何理由,就会主动和别人打招呼,或者找一个活来干

    这种有所求,静不下来的状态,可能是人能不断学习优化的根基所在

    但是,人的大脑神经元随着认知的发展,会自动改变形态和重新连接,ai 却无法在推理时改变内部参数,具有滞后性,也更依赖数据的纯度。所以,在这种训练框架下,会不会有一些细节 ai 拥有学不会?

    另外还有情绪,五感… 哪个都可能成为决定 ai 能不能有自发性的关键

    但是,相关研究未必能得到很好的推进,先不提人类对大脑和内循环知之甚少,研究起来难以下手,社会对 ai 的需求也是作为提升生产力的工具,对把 ai 培养成有自我意识能自我提升的 “人” 恐怕没有那么感兴趣

    (以上全是我高中的时候特别困然后又没事做的时候的奇思妙想,看到佬友的文章有感而发,回忆了一下把大意打了出来,聊增一笑耳)

* 帖子来源Linux.do
返回