开源了一个 0.6B 的 Agent Decision Model:AgentJev,顺手和 Laya 跑了个对比

dijkstra 2026-09-22 23:23 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出




最近自己折腾了一个小项目:AgentJev-0.6B,想给 Agent 做一层轻量的 System 1 decision model。


起因是前段时间一直在看 Jev 这个方向,感觉挺有意思,但 Jev 本身没有完整开源,很多实现和训练细节没法直接研究,所以干脆按照自己的理解重新做了一版。


模型底座是 Qwen3-0.6B,主要做 Boolean / Choice / Score 三类决策。输入可以是日志、diff、trace、工具状态之类的信息,然后直接返回候选项的概率分布,不需要生成文本,decoded token = 0。


算法上我主要做了几件事:让 candidate 之间先互相参考再统一打分;去掉候选位置依赖;训练时直接学习完整 probability distribution;最后再单独做概率校准。


Laya 发得比我早,所以我也直接拿它当 baseline 跑了一遍 Typed Decisions。


目前同一个 2000 题测试集:


AgentJev:79.25%

Laya:77.00%


纸面上高 2.25 个点,不过这个只能说明 benchmark,真实 Agent 场景我还没做完整 PK,这块不敢吹 ^-^


另外我也做了 shared-prefix KV reuse,在 64 Choice + 1 Boolean 这种多候选场景下,实测 609ms → 299ms。


代码、权重和评测结果都已经放出来了:


GitHub:



Hugging Face:



目前还是比较早期的一版,后面准备继续加真实 Agent trajectory、tool routing 和 outcome-based learning。


LinuxDo 大佬多,欢迎帮我看看,模型设计、训练方式、benchmark 哪里有问题都可以直接提,我也想看看这条路线到底能不能在真实 Agent 里跑起来。

一些可视化效果如下:



在claude中的效果:

最新回复 (4)
  • lq-259 09-22 23:25
    1

    牛哇,等分析

  • daisukisatone 09-22 23:29
    2

    下午逛推也看到佬的项目了

  • dijkstra 楼主 09-22 23:31
    3

    被喷了吗,我就是想探究一下jev到底是如何做到的,我尝试用监督微调的方式看看能不能达到他说的rlcd的效果

  • gegege 09-22 23:52
    4

    太牛了佬友,不明觉厉哈哈哈 ^-^

* 帖子来源Linux.do
返回