请教 agent 跑长程任务怎么保障持续运行和质量

tdonline99 2026-07-21 21:11 1

现在主要使用 claude code,想要的效果就是下班前给 agent 派一个任务让持续运行。流程上是先grill-me 写方案,然后让大模型自己写一段喂给 goal 和 loop 的输入,我微调以后开个dontAsk mode, 就让 agent 开始跑,但是现在发现会有一些问题:



  1. 任务有时候会过早结束,比如我要求完成从服务提交一个真实任务,做端到端验证。在反复验证失败后,模型会认为完成不了任务,然后就自行结束或者卡在等待我给方案的循环了

  2. 模型本身会钻牛角尖,遇到问题可能会使用一种很 hack 的方案去尝试解决,浪费大量 token

  3. 上下文压缩。一些模型没有 1M 的上下文窗口,跑着跑着可能就挂了,现在我的方式是让起subagent 定时提醒主 agent 是不是该 compact 了,应该也不是最佳实践


现在除了 fable5,其他主流模型基本都尝试过了,或多或少都有上面的问题,有办法从 harness的角度去解决吗

最新回复 (5)
  • oneclickvirt 07-21 23:07
    1

    我直接codex的plan整完直接goal了,跑了3天现在,感觉中间产物还行吧(


  • Mav 07-22 01:19
    2

    goal要给可量化的指标,否则模型可能会一直在这个模糊的概念里面打转出不来。


    除非是你有一个很好的plan,让他不断去干活,否则不是很建议这样让Agent独自不间断一直跑,因为绕牛角尖,然后在一个方案里面不停的打转是当下模型的常态了。


    很难能力去自己发现当前思路是错误的,然后中断,接着头脑风暴换另外一个充满创意的方案继续,这种恐怕做不到

  • tdonline99 楼主 07-22 11:10
    3

    感谢建议,我有尝试过自己搭建一个workflow,把结束的标准通过脚本来判断,这样会好很多。但是成本会比较高,新的场景就得有新的workflow,不好泛用。


    我目前体感对于复杂些的任务,agent 循环跑完以后,基本都需要人工介入去修正一些方案,现在就是比较好奇网上各种新闻里让 agent 跑几天然后重构xxx是怎么做到的

  • 凤与凰 07-22 11:22
    4

    哇在站里混了这么久,第一次碰到相同头像了^-^

  • oneclickvirt 07-22 21:47
    5

    主要是我这不是一个项目的,我是一整个生态的10个左右的仓库连携的,每个仓库本身已经有现成的实现了,只是需要升级一些依赖,加入一些功能,去除某些bug,所以能跑超级久

* 帖子来源Linux.do
返回