1、关于泄密
政府项目也是分级别的,一般的政府网站开发,都不会要求很严格,有的企业让员工签保密协议,也就是规避一下法律风险。
真的涉及军工,海关的项目(这两类,一类我做过,一类前同事做过),都是在远程机器上开发,代码一行都复制不出来,顶了天就能截个图。自己电脑会安装监控软件(但是我截图没告警,不清楚有没有监控截图)。
远程电脑都是内网电脑,通过专门的定制版远程软件链接,有的甚至通过一个跳板机再连一次,内网都是私库,即使 cc 进了私库能安装,也不可能内网上传。如果你做的那个部门项目,有采购的自部署的 ai 可能可以用用,一般也是没有的,而且这种单位招标采购再到部署流程慢到爆炸,有也是落后一两年的版本,不会有 kimi k3,dsv4 这种新的,dsv3.2 都算先进了。(当时只有个网页版的 chat,api 都没提供,不清楚是没有还是领导没要来)
A/那报告说的,就不可能是从这种单位流传出去的。
2、关于蒸馏
目前在一家国内前十不进前五的互联网公司,如果是训练 coding 模型,需要数据完全没有进行所谓蒸馏攻击的必要。公司内部有完整的模型网关,基本所有的叫得上名字的模型都会采购接入,包括 claude、gpt(claude 从 8 月开始封禁严重,包括 aws 和vertex 的企业号),盈利好的部门或者核心部门,都会给员工开通 opus 级别模型,像是 kimi、glm 等便宜的国产模型,一般都是默认全员开通,不需要部门申请的,额度基本够用。通常也会提供内部版的 chat 网页版,这个更是,火的模型像是 claude、gpt、gemini都会接进去随便用。
如果做模型训练,接入的这些模型,都是经过自加模型网关转发,数据都完整保存,像是阿里这种几万十几万员工,每天产生的数据都是海量的,完全没有进行所谓蒸馏攻击的必要。关键这种数据,如果基建做得好,完全可以和其他内部关于 pr 流水线评审、测试的ai评审、ai安全评审关联起来,进行数据质量分析评审测评,数据质量起码是中上游的,且都是基于真实需求的数据,种类齐全,数据完整。
直接用这些数据还会有效益产出,有必要去单独蒸馏?所谓蒸馏,也不可能只蒸一个模型,要多个模型印证进行质量评估,花个几千万去蒸那么点数据?还不如直接给更多部门都开通高级模型权限,去进行所谓蒸馏攻击,我理解纯脑瘫行为。。。。。所以对那些指控阿里蒸馏攻击的,我实在理解不了。(这种情况不适用 ds/kimi/glm 这种规模小的公司,不了解不做推测)
如果说,用自己公司员工的数据训练算蒸馏,全世界哪家模型公司不这样做? ^-^