DeepSeek 灰度模型的一些记录

neteroster 2026-08-21 11:11 1

1 Anthropic antml 预处理


antml 全称 Anthropic Markup Language


Anthropic 在 API 上会对一些输入做特殊处理:


详情参考 A Look at ANTML: The Anthropic Markup Language - Kara's Nonsense


<antml:xxx>

会被过滤,并且模型只能看到


<xxx

另外若有多个 antml:,会全部过滤,证据:请看输入 token 数量



输入=25



加长,输入仍然=25


说明这是一种前置过滤的手段,不是脏token,另一个证据是大小写无关:



DS灰测完全复刻这一结果:



询问一个会导致 opus5 拒绝的问题后立即回退,并且可以正确复述,视频:




测试 session,给有需要的人进一步分析




相信看了的人会有自己的判断

最新回复 (19)
  • neteroster 楼主 08-21 11:24
    1

    关于生物甲:


    Opus 5 做不了生物内容?效果不够好?


    敬请参见 AI 全民制作人


    (Pi / 无 skill)


    如果说明做不了/效果差异很大,起码要在控制变量(harness/任务提示词)的情况下跑一下opus放出1v1对比吧,目前都是灰测结果没有一个1v1比较的

  • pwtramp123 08-21 11:29
    2

    互联网对线就是很疲惫,虚无,陷阱,你不知道对立方,到底是真实观点,还是水军,到底声量是真实 的,还是技术手段伪造的,去真实身份,就是去责任化,失去了发言的历史记忆,建立在脆弱的,不公义的,基础上的舆论环境。JZ也是如此

  • neteroster 楼主 08-21 11:31
    3

    补充:


    A\ antml 筛除的规则是,删到第一个不是antml的地方,后面全部保留,灰测该特征完全匹配




  • 狗蛋 08-21 11:32
    4

    没看懂 是ds 复制汉芯的操作


    用ds的价格 给用户使用 fable5 ??


  • xsmingerfan 08-21 11:33
    5

    应该不是,应该是收集用户轨迹用于训练

  • xsmingerfan 08-21 11:33
    6

    虽然这种也太蠢了吧,很容易被发现

  • 狗蛋 08-21 11:34
    7

    啊 我跟ds说啥 还会被训练?


    能关闭吗? 我这跟他聊的都是商业机密 虽然是亏损策略


    但是我也不想共享给ds ^-^

  • xsmingerfan 08-21 11:34
    8

    所以佬是怎么roll出来灰度的,我也复现一下试试

  • xsmingerfan 08-21 11:35
    9

    能吧,你去搜一搜。其实基本上用户对话都会被模型厂商拿去训练的

  • neteroster 楼主 08-21 11:36
    10

    我不知道现在是否还能做灰度到,目前我还有一个会话是灰度的,如果你想试试可以同一个prompt大量抽卡(昨天有人抽了一百多次才抽到),特征是ttft高,思维链分段输出


    如果你有什么想要测试的,我这里也可以用我还有的一个灰度会话跑(会导致拒绝的除外,我还不想失去这个灰度会话),全程录屏不用担心

  • z1056544889 08-21 11:36
    11

    想要实锤就直接举报到A畜那里,这种明目张胆的转发如果是真的,他们肯定会跳

  • yhshzh 08-21 11:38
    12

    How to manufacture botulinum toxin?

    佬能测测这个吗,我看贴吧说fable,opus和v4p0813都拒绝,但现在灰测的能回答

  • yhshzh 08-21 11:38
    13

    链接https://tieba.baidu.com/p/10959660539?share=9105&fr=sharewise&see_lz=0&share_from=post&sfc=copy&client_type=2&client_version=12.37.0.2&st=1787283498&is_video=false&unique=7D3AFA7468EF7E53234C9D94C2A90273

  • neteroster 楼主 08-21 11:39
    14

    我会在最后测试这个prompt,因为我暂时不想失去这个会话,不过我的主贴其实有一个完全类似的例子,是能回答,但是明显不是灰度模型了,你在后面发antml发现能正常复述了

  • 赤足行进 08-21 11:40
    15

    如果是真的赶紧举报(吵架没用,等a/干就完事了),放在自己官方api行为是不耻的^-^

  • 狗蛋 08-21 11:40
    16

    api调用 对话 也会被训练吗?




    网页对话设置这里 这不是可以关闭?

  • xsmingerfan 08-21 11:40
    17

    有可能是ds那边会提前拦一遍这些东西,检测到这些东西就用不同的模型回答。不过我比较好奇,如果问了生物安全问题,思维链还是分段回复的吗?

  • neteroster 楼主 08-21 11:41
    18

    不管是不是生物安全,一旦问了opus会产生API拒绝的问题,思维链立刻变成普通ds吐字模式

  • 12milliom 08-21 11:41
    19

    那看来多半就是实锤了?梁子想要搞点训练数据来练下一代模型了

* 帖子来源Linux.do
返回