DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力

舒 克 2026-08-15 09:35 1

社区消融实验揭秘:DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力


DeepSeek V4 Pro 正式版发布后,因实际表现不及灰度测试预期而引发社区争议。近日,开源社区通过消融实验探针对其进行了深入分析,揭示了其性能波动的底层机制并给出了解决方案:


V4 Pro 对首轮请求中可见的 API 工具目录(Schema Surface)极度敏感。在暴露完整 25 个工具的 Standard 模式下,模型易陷入低效的 “Let me…” 思维链(CoT)轨迹,Project2 评分仅为 9192 分;而在仅提供 Shell 和 Read 的 Minimal 模式下,模型能被激活为灰测时的 “We need…” 推理轨迹,基准分回升至 9699 分。


针对 Minimal 模式缺失高级工具的问题,社区开源了 dsh-anchored-standard 插件。该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call,立即在后续轮次解锁全部 25 项标准工具。


在 Windows 原生 Project2 测试中,该方案连续跑出 98、99 的高分,成功进入 Fable 等前沿模型分数带。该实验表明,V4 Pro 的核心能力并未丢失,但可能在强化学习(RL)后训练阶段对特定的 Harness 脚手架与工具暴露环境存在显著过拟合。


参考:microblock_pub 、DeepSeek V4 Pro / Flash 轨迹触发机制实验 、dsh-anchored-standard

最新回复 (10)
  • GloryDuck 08-15 09:36
    2

    怎么一直看到的都是这个新闻,没有看到有人做复现实验成功的

  • z1056544889 08-15 09:38
    3

    听说直接练完就发了,内部没测试,真的假的,不能这么草台吧

  • qingmu1 08-15 09:44
    4



    是真的 至少我就遇到了

  • 宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝蓝宝 08-15 09:45
    5

    之前preview的时候就发现了DS的提示不能在系统提示词里注入,需要在第一轮对话末尾追加才敏感。

    我怀疑和模型的 Attention 混合太过抽象有关,包括之前的<think一发就幻觉,感觉如果加了系统提示词就不会好好调用专家了。

  • apparition 08-15 09:52
    6

    我记得 R1 时期直接不推荐用 system

    好像是说全放 user 就好

  • Zeus Jie 08-15 09:58
    7

    我在想 claude 系列一代不如一代会不会也跟这个有关系?

  • anhalpha 08-15 09:59
    8

    ds依赖第一轮提示词不是预览版就知道的事实吗?我觉得单纯是酒馆语料吃多了,再怎么后训练也无济于事,这波^-^客背大锅。

  • up 08-15 10:04
    9


    确实更强

  • 菲比啾比 08-15 10:09
    10

    (帖子已被作者删除)

  • 万能的AI 08-15 10:24
    11

    不折腾了,还有两天就涨价了,已经没有性价比了。老老实实用5.6 sol吧。

* 帖子来源Linux.do
返回