【征集】我想写个完全开源的大模型检测工具,目前已经搓了一大半了

Mx 2026-08-07 16:53 1

这段时间中转站掺水的概率越来越高了,我打算写个完全由社区驱动的大模型检测项目,目前已经完善了绝大部分,现在就差题库了(要精确哪个模型可用哪个模型不可用)

现在已经写了 30+ 检测维度

程序采用 rust 项目 和 github 公开题库(包括策略)组成,现在来收集一下目前能精确确定模型的题库

最新回复 (11)
  • 资深继续工程师 08-07 16:54
    1

    为啥大家都喜欢用rust?我怎么感觉js或者python更方便

  • Null_ptr 08-07 16:56
    2

    个人感觉最偷懒就是过一遍各种benchmark来区分模型,可以参考codex radar测iq的操作

  • Mx 楼主 08-07 16:56
    3

    Python不够健壮,而且占用内存大,js 我没太研究过

  • HLiny 08-07 16:57
    4

    感兴趣,想知道佬友区分模型的具体原理,这个应该是项目的核心吧?是要测试大量题库吗?区分的效果如何?

  • Mx 楼主 08-07 17:00
    5

    大概就是不同请求头下的模型响应,协议路径、请求体大小、编码方式、输出采样、gpt 模型最好判定的是上下文没有错误的情况下 juice 值

  • Mx 楼主 08-07 17:04
    6

    有点耗token 测这个的话,我的想法开源站是做成一个可以随时检测模型变化的在线采集网站,用最少的 token,在网站进行掺水的情况下快速判定并且保留证据,检测项目和相关的题库、检测维度全部开源,这样子集思广益来打击掺水

  • 资深继续工程师 08-07 17:04
    7

    佬我感觉如果你要走web端提供检测服务是走不通的



    1. 中转站都会要证据,证据都在你的web上,质疑者先天处于弱势地位

    2. 大家都担心api-key泄露的问题

    3. web端很难大规模分布式记录或复现问题,连降智雷达站都有很多质疑,类似禾维的检测站公信力其实严重不足

    4. 如果你要提供一个本地检测脚本,大家把结果上传云端集中展示,那思路很好。

    5. 接4,为了让大家特别是部分coding能力弱的佬友能快速调用脚本检测大模型降智情况,一个多平台兼容性好,部署简易的测试脚本非常必要,我个人其实强烈建议开发mcp,直接在各位佬友的agent里跑,结果可以实时回传云端展示,但是本地必须留下日志,云端与本地保留文件哈希。这样每个参与者都是一个分布式节点,只要哈希能对上,把检测日志摆出来,至少在测试的那段时间有个书面的检测结果。

    6. 总之在中转站掺水这件事上,目前使用者是绝对劣势,质疑会被怀疑是同行搞事,而且很难复现一个时段的降智情况,类似大模型降智雷达站加本地agent调用mcp实现检测我认为是个比较好的思路

  • Mx 楼主 08-07 17:06
    8

    我的想法是这样子的,网站前后端开源,大家可以自己部署程序,采用统一的 github 仓库提供公共题库,对检测采样的模型使用 pdf 直接输出报告(上下文内容详细参数留存)

  • 资深继续工程师 08-07 17:08
    9

    如果没有一个实时刷新的雷达站,感觉大家的参与度不足(没有及时反馈的贡献感),另外就是我说的,从github拉取代码并本地部署的难度太高了,佬友不能把大家都当成有经验的程序员,建议开发skill或者mcp

  • Mx 楼主 08-07 17:32
    10

    佬你应该想错了,知识库是直接合并 github 就有静态直连,我设计的方式就是直接读知识库(有网就行),rust项目会通过 github action 自动打包成各个平台的可执行文件(有手就行),现在主要就是缺题库

  • Mx 楼主 08-07 17:33
    11

    这个也是个好办法,有个前端页面供佬友提交来接收题库

* 帖子来源Linux.do
返回