连续一个多月使用多agent编排来编程,相对于单项任务的完成程度,我的体会是如果追求人在回路权重的减少,模型的全局视角和思维连续性更加重要.
目前实际使用下来,国内现在做到这一点的是glm-5.2以及glm-5.3,国外opus4.6以上gpt terra以上都达到及格线,kimi k3能勉强摸到门槛,但是在指令遵循方面好像有一定的问题,总体来说k3和5.2,5.3都有能力替代程序员本身完成对任务的拆解和编排并对整体完成度进行验证.
这一类模型的典型特点是思维准确,废话很少,思维链相对较短(glm5.2是个特例,思维链较长但是长程能力比较不错).使用中发现,类似deepseek v4f这类思维链较长的模型在可能会陷入局部注意力而导致编排失败.
在多agent编排中干活的worker,只要有基础的编程能力和指令遵循都能很好的工作,模型的好坏取决于速度和编程的准确率,包括deepseek,qwen,月之暗面,智谱,minimax的非旗舰主流编程模型.
在编排上的准确率来说,只要达到及格线的主模型搭配工作模型,无论哪种搭配对任务最终的准确率影响不大,区别在于任务时间和工作模型结果被打回的次数.这一点比较奇怪,我把它归结成为旗舰模型的泛化能力可能接近触顶的表现.
所以我的看法是,如果使用多agent编排,实际上对于模型的选择很宽泛,只要达到及格线的主从模型选择,大致上都可以达到1+1>2的效果;如果习惯于手动发布任务,那么在预算足够的情况下尽可能选择编程方面比较突出的顶级模型,预算紧张则选用glm,deepseek v4f这类编程特化的模型.