梁子有没有给harness鲸子下毒?

QQQWW 2026-08-15 08:11 1

从DeepSeekV4正式版的含"We"思维链开始讨论


看到不少佬说极简模式能抽出来聪明版的pro,我便怀着抽出来个好的对话就美美开玩的心开始了一遍一遍的测试,忙乎半天,最后结论为在harness中无稳定触发此思维链方式

将模式换为插件 dsh-anchored-standard添加的模式,权限保持默认的工作区写入,抽出这种思维链的概率相对高一些,但整体仍然非常玄学且概率低下


同样的测试输入,但测试场景切换到了Cherry Studio,无系统提示词的情况下几乎必出We need… 是不是我刚才测harness的姿势有问题?


回到harness,一直没变的提示词拿过来再测,奇怪的是,无论如何也抽不出来we need了,无论极简还是标准,max还是high


再回到Cherry Studio,仍然稳定we need,加上从harness中扒的提示词就变成了the user,真是提示词的问题啊


还没死心,我大胆猜测,有可能梁子学a/找中国用户一样,藏了些小阴鲸?比如api针对harness还下了毒,被模型能力掩盖导致不同的模型在harness表现差不多?我便让harness自己测自己,它的结论是:



真的是这样吗?是不是藏得更深?



好吧,我信了,牢梁终归还是没掉成梁/

在我一番猛烈操作下,把原本就对的结论证明成了对的

对的,还真就是模型吃不消提示词的问题

至于we need…下的模型能力是否真的有提升,在这里仍没有答案(


含泪把分区从开发调优改成搞七捻三,打上纯水标签滚去睡那该死的觉

最新回复 (7)
  • apparition 08-15 08:33
    1

    所以只要第一轮 system 空提示词就行?

  • QQQWW 楼主 08-15 08:36
    2

    理论来说是这样,模型没背着提示词的情况下基本都是we need…的回复

  • apparition 08-15 08:38
    3

    那感觉得把 system 放的初始提示移到 user

    但效果不知道好不好

  • QQQWW 楼主 08-15 08:41
    4

    空载跑一轮出思维链然后在加提示词的测试我没搞

    但看这个现象是单纯的输入过重影响了模型,其后续被脏上下文一直压着也无法发挥出真正水平,单纯把提示词改个位置而不增减首轮输入总量应该不能改变什么

  • apparition 08-15 08:42
    5

    因为 deepseek 过去有不使用 system 角色的传统

    后面才改成可用

    所以我好奇放到 user 会不会有改善

    不然这样整 harness 根本用不起来 ^-^

  • 索隆 08-15 08:43
    6

    他是开源的你怕什么,自己看下源码就知道了,A/的Claude code也不开源

  • QQQWW 楼主 08-15 08:44
    7

    那是预览版对角色扮演的特化来着,一同带的还有第一视角, 正式版好像是没有了

* 帖子来源Linux.do
返回