【开源推广】我把主流 Agentic RL 算法全复现了一遍做成了开源教程,顺便找 PyTrio 官方给佬友们薅了 100 份代金券

KMnO4-zx 2026-09-08 19:53 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI 生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


佬友们好,来宣传一下我自己的开源项目 Agentic-RL-Lab !


我把主流 Agentic RL 算法全复现了一遍做成了开源教程,顺便找 PyTrio 官方给佬友们薅了 100 份代金券!




先说我为什么搞这个仓库。我一直想系统研究一遍 Agentic RL,但拖了很久很久很久一直没动手。一是没卡,二是完全搞懂 verl 那种训推一体的框架太难了,工程代码耦合非常严重,光把训练循环从一堆抽象里捞出来就要半天。后来接触到 PyTrio,一个远程后训练服务,思路类似 Tinker,本地只写数据、reward 和训练逻辑,前向反向、采样、权重更新全在云端。发现这东西把算力和工程两层门槛都铲掉了,就干脆一边学一边把过程全部搞成了笔记,只花了一个多月吧,我现在只要看一眼 RL 论文的公式,就大致知道怎么复现这个算法了。


现在仓库里有 GRPO、DAPO、GSPO、OPD、OPSD、Search-R1、ReTool、ALFWorld、Vision GRPO、TEMPO、AgentOPSD 等算法的复现代码和复现笔记。





覆盖了从 GSM8K 上的 GRPO 入门,再到 Search-R1 多轮搜索、ReTool 代码沙箱、ALFWorld 这种 16K 长轨迹的家务 Agent 训练都有,多模态的 Vision GRPO 也安排了。本地不需要有卡,这一整套是在我的 MacBook Air 上训练完成的。



我自己跟完一轮最大的感受:RL 的门槛一大半其实是工程和算力,算法本身没那么复杂。如果你也想入门 Agentic RL 但一直被算力劝退,那这个仓库应该能帮到你。


然后是羊毛时间。因为仓库的实验都是走 PyTrio 的,我去联系了 PyTrio 官方,说想给 L 站的佬友们送点福利,对方很爽快,批了一批代金券:100 份 50 元代金券,每份有效期一个月,先到先得。


领取方式:回复本帖,说明你在做哪个方向的大模型训练:SFT、RL、Agent RL 都行,搞 AI4S 的佬友也欢迎。再留下注册 Pytrio 的邮箱(不想公开的可以私信我),前 100 位有效。应该会在明天晚上统一发代金券,发了之后我在评论区提醒佬友们~


如果你有正经的 Agentic RL 科研 idea,想做论文或者项目,可以直接发邮件到 [email protected] 申请科研代金券,额度会很大!但审核也比较严格吧,proposal 要认真写。PyTrio 官方也挺乐意赞助大家做 Agentic RL 方向的论文和项目。


券有效期一个月,领了就记得用嗷,别放着吃灰;这批发完官方会看使用情况,用得好的话我下次再去帮大家申请(笑


仓库地址再放一次!




README 里有微信交流群入口,跟的过程中卡住了可以去问,也可以在帖子里直接问我,看到都会回。




最新回复 (2)
  • KMnO4-zx 楼主 09-08 20:06
    1

    忘记写了这是 PyTrio 官网:PyTRIO · 大模型训练引擎

  • 南海 09-08 21:27
    2

    哇哦感恩。我在做agent RL,但是现在还处于学习阶段,可以领取一份吗

* 帖子来源Linux.do
返回