【讨论】harness如何改变推理和模型训练

amo 2026-08-14 08:13 1

我的理解:harness是马鞍,是缰绳,是指导模型规范工作的框架。大家最开始研究的提示词就是最小的harness。但是提示词约束力不够,于是演生出更细致的工程约束。所以harness显然是必要的,它可以改变推理内容。

更进一步的,大模型公司为了提升效果,肯定会针对harness做优化。所有harness会影响模型训练。因此模型在不同的harness表现有差异是正常的。


顺便说一下deepseek,我自己还没有用过deepseek-v4-pro,但是从论坛的帖子可以看到它在pi里的效果似乎好一点,同时它在dsh里的缓存也很高。我之前了解到pi的缓存也是非常高的。如果你发送的请求前面的内容与之前发送的请求相同,那么相同的部分就是命中的(后面不相同的部分是不命中的),注意,缓存是严格匹配的,而不是看相似度。所以如果你在最前面改一下时间,那它就完全无法命中了。所以要缓存高,你的请求只能是追加内容,而不能修改前面的内容。对应到模型来说就是你训练时应该强化追加新内容,而不是把新skill或工具插入前面的提示词。当然具体我也不知道deepseek是怎么做的。一点自己的看法。

最新回复 (2)
  • amo 楼主 08-15 08:01
    1



    一定程度验证了我所说的

  • zcrdwx 08-15 08:06
    2

    肯定会针对harness做优化



    目前看来dsv4 系列并没有对harness做优化,RL的环境中只有bash/editor两个工具,而flash也是这么训练出来的。甚至官方也明知这一点,可以自行查阅dsh中git commit

* 帖子来源Linux.do
返回