跨模型文风指纹分析:多家AI实验室模型写作习惯惊现高度相似,GLM文风紧贴Gemini,Kimi紧贴Claude

Bunn 2026-07-21 09:58 1

一项针对22个主流AI语言模型的写作风格分析近日引发广泛关注。研究人员借助统计工具Fable,对同一批测试题目下各模型的原始文本回答进行了交叉熵比对,结果显示:不仅同一实验室旗下的模型写作风格高度接近,部分来自不同实验室的模型之间也呈现出异常相似的语言特征。


研究人员将每个模型在所有测试题目中的回答汇总为一个文本语料库,并基于字符三元组(即每个连续的3个字符构成的滑动窗口)计算其概率分布,从而为每个模型建立独特的"语言风格模型"。


这一方法虽属初级语言建模技术,但建立在数千份样本之上,远比单纯的评分更能反映模型的内在语言习惯。


研究强调,此次分析仅比较语言风格,包括词汇习惯、格式偏好、语气寄存器等,不涉及模型的立场或观点内容。


研究者预期同一厂商旗下的模型因共享训练数据基因而风格相近,同时也坦承存在冗长度混淆变量的潜在影响


研究按模型的真实研发方进行分组,对通过OpenRouter接入的模型作了专项溯源:Kimi归属月之暗面,GLM归属智谱AI,DeepSeek归属深度求索,Grok归属xAI(2026年7月起更名为SpaceXAI,但视为同一家族)。


跨实验室相似的判定依据为:当某对跨实验室模型的风格散度,小于数据集中同实验室模型对的中位散度时,即触发预警。这一阈值完全由数据自身决定,不存在人为干预。


方向性推断仅依赖发布时间。统计方法只能说明两个模型写法相似,无法断定谁学习了谁。晚于某模型发布这一事实,仅作为训练数据截止时间的代理指标,提供因果方向的参考线索。


全部分析数据均来源于同一次基准测试运行,评测名称为"You’re absolutely right!",运行于2026年7月18日。22个模型在完全相同的条件下回答相同的测试题目,共采集模型原始文本584,655个字符。数据已逐字嵌入分析文件,任何人均可从单一文件完整复现全部结论。评测本身的评分数据已随快照一同保留,但本次分析完全不使用评分,仅用文字。


研究人员目前未作最终定性结论,但表示结果相当可疑,并呼吁社区对数据与代码进行独立审查。





如图,越蓝表示在同一个测试集上回答越相似。

最新回复 (2)
  • zetsubouss 07-21 11:30
    1



    省流:蒸了。

  • OptionalFullName 07-21 11:32
    2

    这个倒回来做个中文版,就知道 OA 跟谁学的中文了,学的不说人话

* 帖子来源Linux.do
返回