使用 AI 后的一点思考

jerry 2026-08-21 11:56 1

现在的大模型评价标准有一个越来越明显的偏好:让模型在长线任务上、在完全没有人类反馈的情况下,自主地把 benchmark 分数推到更高,它们都在奖励同一种能力——给一个目标,给足工具和环境,剩下的全部自己来,直到任务达成。


我对这种偏好有一个疑虑。为了"长线自主"而训练的模型,在任务的中间节点会按照优化目标充分剥削局面:它倾向于做出只为当前目标服务的特化决策,因为那样做能让它在后续拿到更高的分数。但真实世界里很多有价值的东西没有明确的结束节点,一个系统必须保持继续演化的可能性,这就要求过程中框架始终“干净”。模型似乎没有"保留余地"的意识;或者说,它在"保留余地"和"把某一点优化到极致"之间,建立不起良好的平衡。


虽然确实可以通过打磨提示词、反复交互来改善以上的不良表现,但我感觉这些都只是治标不治本的手段,问题的根源还是在于模型本身。


以上只是我个人一点臆想,想听听各位佬有没有相关的思考 ^-^

最新回复 (1)
  • 小叮当 08-21 12:24
    1

    AI其实应该作为一个干活的辅助,但是这样子卖不出好价钱,各大厂家都在往AGI方向推,企图打造出一个全能的上帝。

    结合目前各种降智的情况,不怎么理想,全能的上帝怎么能够变成唐氏呢 ^-^

* 帖子来源Linux.do
返回