DeepSeek Harness的过拟合问题测试

TOT 2026-08-15 10:43 1

前面已经测试过了deepseek-v4-pro模型Max思考在dsh和oc中的表现,近期部分佬友在讨论dsh和过拟合问题。遂进行部分测试,并列出思维链的统计信息。测试均使用Deepseek-v4-pro模型Max思考。


测试项目有五个:




  • Macos平台dsh:标准模式、提示词修复模式




  • Linux平台dsh:极简模式、极简模式(英文提示词)




  • Opencode Pure模式




对照组有一个:



  • kimi-k3(使用Kimi客户端测试)


先贴测试汇总信息


不同测试项的思考块关键词统计



不同测试项的运行指标



对照组结果:


1. Kimi-k3



使用Kimi客户端Work模式,开启极致思考,开启1M上下文



预览链接



测试结果:


1. DSH-Mac平台-标准模式


预览链接



初始思维:





2. DSH-Mac平台-提示词修复模式



使用流传的插件来使标准模式尽可能的符合极简模式的System Prompt,触发不同的思维链。

GitHub - xiaobright/dsh-anchored-standard: Two-phase DeepSeek Harness preset: Minimal-aligned bootstrap, then full Standard tools (Project2 98/99) · GitHub



预览链接



初始思维:





3. DSH-Linux平台-极简模式



Linux平台+极简模式有概率触发特殊思维链。



预览链接



初始思维:





4. DSH-Linux平台-极简模式(英文提示词)



Linux平台+极简模式+英文提示词有概率触发特殊思维链。



预览链接



初始思维:



5. OpenCode-Mac平台



Mac平台+Pure模式+中文提示词



预览链接



初始思维:


最新回复 (8)
  • Hifumi Mizuhara 🍥 08-15 10:47
    1

    我的天,偏差也太大了吧,特别是linux+极简模式那个很不错啊

  • TOT 楼主 08-15 11:07
    2

    linux+极简模式这版也存在问题,右键拖动方向反了。。。

  • exboy 08-15 11:09
    3

    弱弱的问题一句,和过拟合 这个是什么意思

  • TOT 楼主 08-15 11:10
    4

    近期部分佬友在讨论 dsh 和 过拟合 问题

  • 08-15 11:11
    5

    过拟合就是模型学太多了以至于把噪点和无关紧要的细节学进去了

  • role_c 08-15 11:14
    6

    ds的方向搞反好像是老问题了,不知道其他模型有没有这个问题,之前灰测到的那个模型也偶尔会搞反

  • yunshuiyao 08-15 11:15
    7

    过犹不及,大概就这个意思,训练过度了

  • TOT 楼主 08-15 11:18
    8

    从我的测试结果看,似乎各种思维模式,并没有拉开很大的差距。


    但是又有佬友说 benchmark分数增加了不少。

* 帖子来源Linux.do
返回