今天被中转的 astra 恶心坏了,一堆披着羊皮卖狗肉的,模型用着货不对板,一气之下让 astra 协助我做了一个掺水测试 App,折腾了半天总算是做出来了,现在分享出来给佬友们试试
主界面:

模型报告页面:

主要思路就是通过各种论文里的方法获得模型指纹,然后通过对比 astra 和其他几个 gpt 的模型的指纹差异,分析出最终结果,然后我在此基础上用了官方的渠道采样,这样佬友只需要比较要测渠道和官方的答案分差异就知道了有没有掺水了。
里面的基准题目也是我(其实是 astra)精心挑选的,前面一共测试了论文里的动物、鸟、国家、随机数这几个比较热门的模型指纹基准,还有一些冷门知识和具体数值,分了好几轮采样,实践下来发现有些题第一轮看着区别很大,第二轮就一模一样了,最终可以稳定出现差异的只有这五组,分别是:
1 组 随机动物、随机鸟、海卫二公转周期。
2 组 随机国家、土卫八公转周期,。
其中第一组的测试中 astra 在官渠情况下可以稳定和其他模型出现差异,所以列为直接性模型指纹判断,也就是直接判断你用的这个模型到底是哪个,第二组因为 astra 和 sol 出现严重的答案吻合问题,只能用来辅助判断,作用是用来排除模型是不是 luna,terra
另外:因为 astra 目前无法稳定获得 juice 指的原因,我并没有把 juice 测试加入基准里面
所以目前已经内置 Astra、Sol、Terra、Luna 的参考数据,测试选项每组默认十次,一共五十次请求,另外设置了并发选项,保证测试速度酷酷快 然后可以查看基准和每条回答,不放心的也可以用自己放心的渠道重新设置基准
方法上主要参考了:
• heymeow 佬:大方向几乎是看了这位佬友的帖才定下来了,感谢这位佬提供的宝贵思路,佬的模型测试器也更新支持 astra 了,也很好用(gpt掺水/降智检测器,从此告别掺假![附实战案例] 9月5日 4.5.0重大更新 前往新帖
• hanlinwenyuan 佬:关于模型概率数分布的一些尝试主要得益于这位佬,虽然目前版本还没上,但我准备在下个版本添加这功能,所以也感谢这位佬 (https://linux.do/t/topic/2472419)
•论文 One Token Is Enough:看模型对简单短答案题的选择分布。动物、鸟、国家这部分参考了这个方向。( [2607.10252] One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions )
• 论文 KBF:Knowledge Boundary as Fingerprint:利用知识边界附近的稳定数值回答做指纹。数值题借鉴了这个思路。( [2605.29524] KBF: Knowledge Boundary as Fingerprint for Language Model and Black-Box API Auditing )
同时感谢两家上游项目,分布检测和先标定再对照的思路给了不少帮助:
• chen-006/gpt56apidetector
• hanlinwenyuan/hlwy-ai-checker
现在还是开发版,有什么意见佬有可以告诉我,我会做后续更新的
安卓用户可以试试,有结果或报错欢迎反馈。
下载:〔Gofile — Cloud Storage Made Simple