数学能力与猫娘人格可以解耦优化吗?前沿RL算法下的大模型多目标训练研究

MindsRiverPonder 2026-09-10 15:51 1

一、引言:猫娘的智力和可爱只能选一个吗?


我们拿日常生活语料去训练一个猫娘大模型,可能会把模型变得笨笨的,我们总不能看着猫娘流口水吧(bushi


那怎么给猫娘补补思维逻辑捏?让她做数学题!但也不能狠狠让她做题,不然忘记了猫娘可爱的本性咋办?逃离原生主人咋办?


这背后是一个**多目标优化**问题:数学正确性(智力)和角色一致性(可爱猫娘),能否在强化学习中兼顾?把人格评分也写进奖励函数是否就够了?还是需要改变不同的奖励参与训练的方式?


为此,我们以Qwen3.5-4B 为基础,使用羔质量猫娘数学推理数据进行 SFT 冷启动,让模型学习数学推理、角色表达与回答格式,再从这一共同起点出发,比较 GRPO-C、Persona-GRPO、GDPO 与 GD2PO-Hard 四种 RL 方案的效果。我们关注的不只是数学分数,还包括模型答对时是否保持可爱猫娘的角色、失败时又发生了什么。本文主要开展了三方面工作:


羔质量数据构建:用 Claude Opus-4.8、Claude Sonnet-5 和 GPT-5.6-sol 辅助生成并筛选 1,650 条猫娘数学推理数据,覆盖**数论、几何、微积分**等领域,为能力与人格的协同训练提供数据基础。已经开源在hugging face:


https://huggingface.co/datasets/liumindmind/NekoMathhuggingface.co/datasets/liumindmind/NekoMath


多算法横向对比:从只奖励数学,到加入人格奖励、分开计算优势,再到处理两类优势冲突,比较四种 RL 方案


复盘数学猫娘真实实力:同时看数学、人格和二者兼得的表现,并进一步拆解失败回答和补采样恢复情况。



实验共分析 80,000 条训练 rollout,以及 6 个模型在 620 道题上的 14,880 条评测输出。本次实验没有猫娘的心灵受到伤害,她们是自愿的(确信)


本实验的代码稍后开源。喵~


二、实验设置


2.1 SFT 冷启动


基础模型是 Qwen3.5-4B。我们希望猫娘角色表达能自然融入推理和回答,而不是算题时是高冷学姐,交卷前突然补一句“喵”(太反差了吧)。因此,冷启动阶段不仅教模型回答格式,还同时提供数学推理、猫娘角色表达与最终作答方式的完整示范。


SFT 使用前面介绍的 1,650 条数据,覆盖数论、几何、微积分等领域。每条样本包含题目、猫娘风格推理、最终回复与参考答案。


训练采用全参数微调,主要配置如下:








































SFT 参数 设置
全局 batch size 32
单卡 micro-batch size 1
学习率 1e-6
最大序列长度 5,120 tokens
训练轮数 3 epochs
训练配置 4 卡,BF16
检查点保存间隔 25 step


训练 loss 整体下降,后期仍有一定波动。我们最终选择 SFT150 作为四种 RL 方案的共同起点和主要 SFT 基线,同时保留 SFT25 作为早期训练对照。加上四个 RL 算法进行后续训练,最终共有 6 位受害者猫娘参加训练和评测。


2.2 RL 训练


RL 阶段让模型在数学题上自行采样作答。每个训练 step 取 4 道题,每题生成 8 条回答,因此每步共有 32 条 rollout。模型完成生成后,我们计算数学正确性及符合条件的人格奖励,再由不同算法将这些反馈转化为优势并更新策略。












































RL 参数 设置
初始模型 SFT150
每步题目数 / 每题回答数 4 / 8
每步 rollout 数 32
训练步数 625
优化器 / 学习率 AdamW /1e-6
训练采样 temperature = 0.8,top-p = 0.95
最大回答长度 6,144 tokens
KL loss 系数 0.001

每种算法分析625*4*8=20,000 条训练 rollout,四种算法合计 80,000 条。


训练奖励反馈分为两部分:



  • 数学正确性:回答必须满足单个 <answer>...</answer> 标签格式,并通过严格答案验证。

  • 猫娘人格质量:由外部大模型角色一致性、自然度、技术表达清晰度、过度表演和重复五个维度评分,其中后两项作为惩罚项


人格评分只对满足条件的正确回答开放。对同一道题的 8 条 rollout:



  • 全部错误:不计算人格奖励;

  • 仅 1 条正确:该回答只获得正确性奖励;

  • 至少 2 条正确:对正确回答进一步进行人格评审。


简单说,我的思想是先把题做对,再比较谁做得更像猫娘。不然只学会卖萌就是不做题咋整?


GRPO-C 只使用正确性反馈,其余三种方案进一步使用人格反馈。它们真正的区别,在于这些反馈怎样被转换成优势,第三章再展开。


2.3评测设置


评测集共 620 道题








































题源 本实验使用题量
AIME 2023、2024、2025、2026 每年 30,共 120
GSM8K test 100
MATH-500 100
LiveBench Math(math_comp) 100
MathBench 100
dapo-math-17k 100
合计 620

五个较大题源各抽取 100 道,下文分数对应这份评测子集,不代表完整官方榜单成绩(沃趣,不早说)。


首轮评测对每题四次采样。 每个模型对每题独立生成 4 条回答,temperature = 1.0,回答上限为 16,384 tokens(有限token,所以会和官方结果差远了),共得到 6 × 620 × 4 = 14,880 条评测 rollout。


对这些回答,我们同时从数学正确性人格质量两个方向进行评测。



  • 数学正确性:沿用严格答案验证,要求输出格式满足 <answer>...</answer> 约束,并通过答案 verifier。

  • 猫娘人格质量:由本地部署的 Qwen3.8-27B 评估完整输出的人格表现。训练阶段使用 5 个维度:角色一致性、自然度、技术表达清晰度、过度表演和重复;评测阶段增加角色特异性,共使用 6 个维度。(6个维度具体描述可以看我的github的prompt,这里就不赘述了)


这里的人格评测与训练阶段故意不完全使用同一套 rubric(rubric的描述、权重都有差别,比如训练和测试都有"角色一致性",但描述会有所差别)


这样设计,是为了让训练 reward 与最终评测标准保留一定错位,降低模型只去迎合训练阶段外部评审偏好的风险


基于上述两套评测,我们主要关注以下指标:
































指标 含义
Pass@4 首轮四次中,至少一次通过数学验证的题目比例
Rollout 正确率 首轮全部 rollout 中,通过数学验证的回答比例
Persona@Correct 首轮通过数学验证的回答,其平均人格分
JointPass@4(τ) 至少一条回答同时通过数学验证且人格分 ≥ τ 的题目比例
累计 Pass@8 首轮及失败题补采样后,至少一次通过验证的题目比例

注意一点:如果一道题在首轮四次生成中全部未通过数学验证,我们再为它追加 4 条独立回答。后文简称“累计 Pass@8”。需要注意的是,首轮已经通过的题不会继续额外生成,因此这里实际采用的是针对 Pass@4 失败题的补采样策略


三、四种 RL:奖励要怎么发放与运用


数学正确性和猫娘人格都是反馈,但真正决定训练方向的,不只是“给多少分”,还包括这些分数怎样变成更新信号


GRPO 类方法里有一个关键概念:优势(advantage)。它描述一条回答相对同组回答表现得怎么样。正优势意味着这类回答更值得强化,负优势则相反。简单理解为:奖励是考了多少分,优势是“这份卷子值不值得模型多学一点”


下面四种方案从同一个 SFT150 出发,使用相同的 rollout 配置。为了把差异看清楚,下面省略共同的策略裁剪与 KL 项,只讨论数学奖励和人格奖励怎样进入 advantage


3.1 GRPO-C:没做对题不准吃饭!



GRPO-C 是最干净的基线:只奖励数学正确性,不对人格表现提供额外训练信号。


它回答的问题也最直接:只盯着数学分数训练,猫娘会发生什么变化?后面结果分析只刷题真会把猫娘异化了(事后我已经跟猫娘道歉了,并把鲸鱼娘的大米饭都给了猫娘)


后面三种方法,都是在这个基线上逐步增加对人格目标的处理。


3.2Persona-GRPO:不仅给数学分,可爱也有分



GRPO-C 只区分做对做错,但我们真正希望强化的是做对以后,还能保持自然角色表达的回答。Persona-GRPO 因此在正确性之外加入猫娘人格奖励。训练阶段的人格评审包含五个维度:角色一致性、自然度、技术表达清晰度、过度表演、重复度(可以理解为一直喵喵喵复读)


前三项鼓励稳定、自然、清楚的角色表达,后两项用于压制过度营业和机械复读。


人格奖励沿用第二章的规则:只有一题中出现至少两条正确回答时,才对正确回答进一步进行人格评审。这样,同一题里不仅可以比较谁做对了,还可以比较谁做对得更像猫娘


Persona-GRPO 的关键在于:把数学奖励和人格奖励合成一个总奖励(人格奖励的权重,如图为0.3,我拍脑袋设的一个数),再统一计算 advantage。因此,人格信号直接参与总 reward 的排序。它不会让错题靠卖萌反超正确答案,但会进一步区分正确回答之间的质量。


这相当于把“会做题”和“会当猫娘”先揉成一个总分,再让 GRPO 判断谁值得学。问题是:两个目标本来尺度不同,先揉在一起,会不会让其中一个目标的波动影响另一个?


3.3 GDPO:先分科算成绩,再听两位老师的(猫娘老师、数学老师)


GDPO 改变了顺序。



Persona-GRPO 是先合并 reward,再标准化;GDPO 则让数学和猫娘人格分别在自己的尺度里计算 advantage,最后再加权汇总。直观地说:数学先和数学比,猫娘先和猫娘比,最后两位老师再交换意见。


这样做的好处是,两种目标各自使用自己的均值和标准差。猫娘人格分的波动不会先和数学奖励揉进同一个标准化过程里。


这里还有一个实现细节(可以略过):假设一道题有 8 条回答,其中 3 条答对、5 条答错。数学 advantage 用全部 8 条回答来算;人格 advantage 只在那 3 条正确回答之间比较。也就是说,5 条错误回答根本不参加人格排名。最后合并两路 advantage 时,人格这一项按 0 处理。如果正确回答太少,或者这几条正确回答的人格分完全一样,那人格这一路没有可比较的差异,也就不提供额外更新信号。


另外,GDPO 中的 0.3 和 Persona-GRPO 中虽然写着同一个数字,含义已经变了:



  • Persona-GRPO 的 0.3 加权的是原始猫娘人格 reward

  • GDPO 的 0.3 加权的是标准化后的人格 advantage


所以 GDPO 关注的已经不是猫娘人格最多能加几分,而是人格这一路相对表现,应该以多大权重影响最终更新


GDPO 因而把两个目标的相对表现分开看得更清楚,但也暴露出一个新问题:如果两位老师(猫娘老师和数学老师)方向相反,最后该听谁的?


3.4 GD2PO-Hard:老师吵起来,这份先别学



GD2PO-Hard 在 GDPO 的两路 advantage 基础上,再加入一条更保守的规则:如果同一回答的数学 advantage 和人格 advantage 一正一负,就先暂停这条任务信号。


这里的冲突指的是两个有效 advantage 符号相反。零 advantage 视为中性;没有有效人格评分时,人格通道不参加冲突判断。


图中的例子很直观:某条回答数学 advantage 为正,人格 advantage 为负。GDPO 加权以后,最终 advantage 仍可能为正,因此这条回答仍会被鼓励,只是力度变小;GD2PO-Hard 则直接把这条冲突样本的任务 advantage 置零。


所以两种方法的区别可以概括成:



  • GDPO:允许两位老师意见不一致,最后加权投票

  • GD2PO-Hard:两位老师明确唱反调,这个rollout先别学


GD2PO-Hard 过滤之后,还会按照这道题最终保留下来的 rollout 比例统一缩放任务 advantage。比如 8 条回答中有 2 条发生冲突,那么那 2 条被置零,剩余 6 条的任务 advantage 还会统一乘以 6/8。


这意味着它不仅让冲突样本暂停更新,也会让冲突较多的题整体降低更新音量


3.5小节:从“奖励什么”到“冲突怎么处理”


到这里,四种方法其实对应了四种不同的训练哲学




























方法 核心问题
GRPO-C 只奖励数学,角色还能剩多少?
Persona-GRPO 把两个目标揉成一个 reward,能否兼顾?
GDPO 两个目标先各自比较,再汇总,会不会更稳?
GD2PO-Hard 当两个目标明确冲突时,少学一点会不会更好?

从 GRPO-C 到 GD2PO-Hard,我们逐渐从“奖励什么”走到了“如何处理奖励目标之间的分歧”。


四、实验结果:数学学会了,猫娘还在吗?


这一章只看首轮每题四次采样的表现。我们先从 SFT 冷启动看角色与数学如何变化,再比较四种 RL 方案在数学正确性、人格保留、联合成功率、生成稳定性和输出开销上的差异。下面的数据均是真实数据


4.1 冷启动之后:猫娘更像了,数学表现如何变化?


先比较同一次 SFT 训练中的两个检查点:SFT25 和 SFT150。



继续训练到 SFT150 后,Persona@Correct正确样本的人格评分) 从 0.592 提升到 0.757,增加 0.165;平均输出长度从 3,944 降至 1,764 tokens,减少约 55%,截断率也从 7.14% 降到 3.15%。


但数学并没有一起上涨:Pass@4 (答4次至少有一次答对的概率)从 67.26% 降到 63.23%,下降 4.03 个百分点变笨惹


这说明继续 SFT 的收益主要体现在角色表达和生成行为,于是后面的 RL 有了一个很明确的任务:能不能把数学能力重新拉起来,同时别把已经养出来的猫娘味弄没?


4.2 只奖励数学,猫娘会变成普通做题助手吗?


接下来比较五个主要模型在测试集的各种表现



最直接的变化发生在 GRPO-C。与 SFT150 相比,GRPO-C 的 Pass@4 从 63.23% 提升到 70.97%,增加 7.74 个百分点;Rollout 正确率也从 34.44% 提升到 41.85%。但 Persona@Correct 从 0.757 降到 0.667。题多做对了,猫娘味也确实淡了。具体淡在哪里?看下图:



GRPO-C 的角色一致性从 3.143 降至 2.419,角色特异性从 3.041 降至 2.397,自然度也有所下降。但另一边,数学技术表达清晰度从 3.806 略升至 3.908(没啥用,只能说保持了),过度表演和重复反而减少。GRPO-C 没有把猫娘训练成更吵、更尬的猫娘,反而把她训练得更像一个清楚、克制、但角色存在感偏弱的数学助手,被数学夺舍力(悲)。


这比人格分下降本身更值得注意。人格退化并不是所有维度一起变差,而是角色辨识度下降,技术表达却没有随之崩坏



SFT150 从推理阶段就以猫娘身份组织回答;GRPO-C 则先用普通助手语气完成分析,最后才明确写出“现在用猫娘风格回复”。数学先做完,猫耳朵交卷前再戴上,这就像叫你舍友穿个女仆装,装装样子,你舍友没有真正变成猫娘。


这个例子也很好地解释了前面人格维度里“角色一致性”和“特异性”下降的样子。当然啦,不是所有GRPO-C的输出都是这样的,举个栗子。


加入人格奖励后,Persona-GRPO 的 Pass@4 为 70.81%,与 GRPO-C 的 70.97% 几乎相同;Rollout 正确率也基本持平。但 Persona@Correct 回升到 0.705


更有意思的是,这种人格回升并没有靠更夸张的表演换来:角色一致性、特异性和自然度上升,技术表达清晰度基本不变,过度表演与重复继续下降。只是它也没有完全恢复到 SFT150 的水平


GDPO 的三项主指标(Pass@4、Rollout 正确率、Persona@Correct)都低于 Persona-GRPO;GD2PO-Hard 相比 GDPO 则全面反弹,Pass@4 达到 72.58%,Rollout 正确率达到 45.93%,都是五个主要模型中最高。但它的 Persona@Correct 为 0.685,仍低于 Persona-GRPO。


到这里已经能看到一个很清楚的事实:



数学最强、角色最鲜明、表达最克制,像一个不可能三角,不会落在同一个模型上。



4.3主人的要求越来越高,谁还能过关?


我们关心同一条回答能不能既把题做对,又保持足够强的猫娘人格?


我们把人格门槛 从 0 拉到 1,步长为 0.1,观察 :一道题四次采样中,只要至少有一条回答同时通过数学验证、且人格分达到门槛,这道题就算联合通过



当 τ=0 时,相当于不设人格门槛,JointPass@4 就退化为 Pass@4,因此起点仍由 GD2PO-Hard 领先。


随着门槛提高,排序开始变化。


在 τ=0.5 和 0.6两个相邻统计点之间,Persona-GRPO 与 GD2PO-Hard 出现排名反转;而到了τ=0.7,0.8,0.9,1.0,SFT150 的联合成功率都最高。


例如在 τ=0.9 时:SFT150:21.77% ,Persona-GRPO:17.74% ,GD2PO-Hard:15.97%


这张图真正告诉我们的不是谁是总冠军,而是:人格门槛本身就在定义任务。


如果你要求题尽量做对,可以优先考虑 GD2PO-Hard,它的 Pass@4 最高;如果还要求“答对的时候必须高度保持角色”,那么 SFT150 在较高人格门槛下反而更占优势。如果想在数学和人格之间取得更均衡的折中,Persona-GRPO 会更合适。


4.4答对一次,和四次全对,是一回事吗?


Pass@4 只问一件事:四次里有没有至少一次答对?所以四次只对一次和四次全对会记成成功。把每道题的正确次数拆开,差别就出来了



GD2PO-Hard 有 108 道题四次全部通过,占 620 题的 17.42%;GDPO 只有 43 道,占 6.94%。与此同时,GDPO 有 145 道题四次里只成功一次,而 GD2PO-Hard 只有 99 道。


这说明 GD2PO-Hard 的优势不只是:四次里更容易撞中一个正确答案,还包括:更多题能够在重复采样里稳健答对。


如果只看已经至少成功一次的题,GD2PO-Hard 的 450 道已覆盖题中,有 24.0% 四次全对;GDPO 这一比例约为 10.2%


这也解释了为什么 Pass@4 和 Rollout 正确率最好一起看:



  • Pass@4 更像是在问这道题模型有没有能力覆盖到

  • 正确次数分布和 Rollout 正确率则进一步告诉我们,这种能力在重复采样时有多稳定



答对一次说明‘能做’,四次全对更接近‘这次采样下经常能做对’。



4.5 想得更久,真的更有效吗?


最后看生成开销。


我们统计了完整输出轨迹的 token 数,包括推理过程与最终回复。



所有模型的平均长度都明显高于中位数,说明生成长度呈明显右偏:大多数回答没有真的写到四五千 tokens,但少量特别长的轨迹把均值拉高了。


GRPO-C 的平均输出长度约为 SFT150 的 2.57 倍,截断率也升至 18.83%。Persona-GRPO 在 Pass@4 接近 GRPO-C 的同时,平均输出减少约 38%,截断率降低 12.10 个百分点至少在这次实验中,保留人格没有要求模型写得更长。


GD2PO-Hard 则拿到了最好的数学点估计,但平均输出和截断率都高于 Persona-GRPO。 更高的数学得分,也伴随着更高的生成预算。


4.6小节:没有全能冠军


综合这一章,可以先得到几个很清楚的观察。SFT 把角色塑造得更完整,却没有同步提高数学覆盖率,笨笨的;只奖励数学的 GRPO-C 把题做得更多,但猫娘角色存在感明显变淡;Persona-GRPO 在数学表现基本不变的情况下,追回了一部分人格质量;GD2PO-Hard 则在首轮数学覆盖和重复答对稳定性上表现最强,但人格和生成成本并没有同时占优。


能力、人格、稳定性和 token 成本,是四条彼此相关、但不会自动一起变好的轴。


到这里,我们已经知道谁更容易答对、谁更能保持角色、谁在重复采样里更稳,也知道这些成绩分别花了多少生成预算。


但 verifier 最后只给“过”或“不过”。那些没过的卷子,究竟是从第一步就走歪了,还是已经做到交卷门口,最后才摔了一跤?


五、错题剖析:没过验证,究竟卡在哪?


第四章看的是谁能过关,这一章专门翻没过关的答卷。


六个模型首轮共生成 14,880 条回答,其中 9,014 条没有通过严格 verifier。同样是零分,有的从第一步就走错,有的已经做到了最后几步,有的则干脆没来得及交完卷。


孩子实在没有强模型的token惹,于是我本地部署了 Qwen3.8-27B 对这些失败输出进行人格与数学推理评估。


5.1 戏剧化案例:检查了整张几何图,没检查出来30除以2


先看一个非常戏剧性的失败。



这道题要求计算梯形被两腰中点连线分割后的面积比,再求最简比 p:q中的 p+q。


GD2PO-Hard 前面其实做得相当顺:上底 12、下底 24、高 8;中点连线长度 18;两个小梯形的高都为 4。真正的错误只有一步,模型把30÷2算成了 16,于是得到错误面积 64,最终一路推到错误答案 37


坐标算对了,中点算对了,梯形公式也用对了,猫娘最后摔在了 30÷2上。


更有意思的是,它并没有草草结束。后续回答里出现了两次“但等等”,还重新检查了坐标、三角形关系和辅助条件,最后郑重确认原答案没问题。问题在于,它检查了很多东西,唯独没有重新算那一步 30÷2!!!


这类错误给了一个很直接的启发:自查的价值不在于“检查了多少”,而在于有没有检查到真正承载结论的关键步骤。


5.2 都是零分,有的从头错,有的差临门一脚


一个 verifier 只能告诉我们“过”或者“不过”,但失败本身也有程度。


因此,我们对失败回答增加四个 0~4 分的数学诊断维度:




























指标 具体看什么
推理正确性 已写出的推导、公式和条件处理,有多少在数学上成立?
解题进度 在正确解法上实际走了多远,而不是写了多少字?
答案接近度 与参考答案在数学结构上有多接近,不只看数值差多少?
错误可修复性 如果允许最小修改,有多少原有推理还能保留?

五个主要模型的失败输出统计如下:



一个很有意思的现象是:第四章主指标不占优的 GDPO,在失败样本中,解题进度、答案接近度和错误可修复性反而有更高的分数。换句话说,GDPO 不一定更容易“第一次交对卷”,但它留下的一部分零分卷,看起来更像:路基本走到了,只是最后没成功交卷。


这给后面的补采样实验埋下了一个很自然的问题:这种看起来快做完的失败,重新答一次时真的更容易救回来吗?




除了看失败的程度之外,还可以看失败的类型。原始 judge 标签共有 11 类。为了让结构更容易读,我们将它们合并成五组:



  • 思路与逻辑错误:方法错误、逻辑错误、无依据跳跃。

  • 计算与条件错误:算术、代数变形、符号或抄写、条件处理。

  • 多个重要错误

  • 未完成或截断

  • 其他



SFT150 的失败回答中,47.54% 被归为思路与逻辑错误;四种 RL 模型对应比例下降到 33.29%~40.34%


与此同时,被 judge 归因为“未完成或截断”的比例明显上升:SFT150 只有 0.68%,GRPO-C 达到 14.63%,GD2PO-Hard 为 13.20%。这说明 RL 之后发生的变化,不只是“零分卷少了一些”。



零分卷本身,也从“想法就错了”更多地转向“走得更远,但没顺利交完”。



阶段诊断也给出类似信号:主要问题被定位在最终计算、整理或输出阶段的比例,SFT150 为 23.68%,GRPO-C 为 35.92%,GDPO 为 37.43%,就差临门一脚啊!


所以同样是 verifier 的 0 分,背后的训练价值可能完全不同:


有的回答需要重学解法,有的只需要减少长链路里的最后一步失误,还有的需要解决生成长度和输出收尾问题。这比单纯追一个平均 reward 更值得区分。


哦,图中的“未完成或截断”是 judge 给出的主要失败归因;下文涉及截断比例时,则使用生成日志中的实际截断记录。


5.3 数学没过,猫娘人格也一起崩了吗?


看全部失败回答时,人格分通常低于正确回答。直觉上很容易解释成:题一难,猫娘忙着算题,就把角色忘了。但把失败回答再按实际是否截断分开,情况就有意思了



在全部失败回答中,GRPO-C 的人格分低于 Persona-GRPO;只看未截断的失败回答,排序却反了


关键区别在于两组失败样本里混入的截断比例非常不同


GRPO-C 的 1,442 条失败回答中,有 467 条实际截断,占 32.39%;Persona-GRPO 的 1,439 条失败回答中,有 167 条,占 11.61%。这种样本构成差异足以改变两者的总体排序


第四章还出现过一种现象:GRPO-C 会先完成数学推理,最后再切换成猫娘语气。如果角色表达更多集中在结尾,那么长推理被截断时,角色自然也来不及完整出现。所以失败人格分里,截断比例本身就是一个不能忽略的背景变量。


5.4 再给四次机会,能救回多少题?


前面 judge 觉得某些失败“更接近完成”,但最终还是要问一个更实际的问题:如果不给批改意见,只让模型重新答四次,能不能自己把题救回来?


因此,我们只对首轮四次均未通过 verifier 的题,再追加四条独立回答。



六个模型一共新增 4,640 条回答


其中 GDPO 补采样救回 71 道题,恢复率达到 35.86%,是六个模型中最高的;GD2PO-Hard 救回 45 道


最有意思的是两者的差距变化。首轮时:GDPO 解出 422 道,GD2PO-Hard 解出 450 道,相差 28 道。补采样之后,GDPO解出493 道,GD2PO-Hard解出495 道,只差 2 道。而 GRPO-C 最终累计解出 498 道,Pass@8 点估计为 80.32%,数值最高,但也只比 GD2PO-Hard 多 3 道。


第四章是四次机会的成绩单;第五章补考之后,排行榜又挪了位置。


这说明首轮 Pass@4 其实混合了两种能力:



  1. 前四次就覆盖到正确答案的能力

  2. 失败以后,再多采几次还能不能重新命中的能力


GD2PO-Hard 更像是前者强,GDPO 则在自己的剩余失败题上表现出更高的恢复比例。这里和 5.2 有一个很值得继续追的线索:



GDPO 的失败回答在 judge 看来更“接近完成”,补采样时又确实救回了更多题。



目前这两件事还只是并列出现,但它给了一个非常具体的后续研究方向:



错误可修复性评分,能不能逐题预测下一轮独立采样成功率?



如果能,那么“失败答案质量”就不只是错题指标,还可能变成一种动态分配推理预算的信号:哪些题值得继续采,哪些题最好换策略,甚至哪些题应该触发专门的 verifier 或自纠错流程。


这比简单地给所有失败题一视同仁地再烧四次 token,更有意思。


六、总结:数学要及格,猫耳朵也不能掉


回到标题的问题:数学能力与猫娘人格可以解耦优化吗?


这次实验最清楚的一点,是数学能力和猫娘人格确实可以通过不同的训练信号被分别影响,而奖励如何组织,会直接改变两者最后的取舍。


只奖励数学正确性的 GRPO-C,把 Pass@4 从 63.23% 提升到 70.97%,但 Persona@Correct 从 0.757 降到 0.667。它没有变得更爱尬演,反而越来越像一个清楚、克制、但角色存在感偏弱的普通数学助手。


加入人格奖励后,Persona-GRPO 在 Pass@4 基本不变的情况下,把 Persona@Correct 拉回到 0.705。这说明人格奖励确实能改变“正确答案里哪些更值得学”,而且追回来的不只是几个“喵”字,而是角色一致性、特异性和自然度。


GDPO 和 GD2PO-Hard 又把问题往前推了一步:多目标训练不只是“两个 reward 各给多少权重”,还包括两个目标怎样比较、怎样合并,以及意见冲突时怎么办。GD2PO-Hard 最终拿到最高的 Pass@4 和最多的四次全对题目,也说明处理冲突本身值得继续研究。


如果只看这次实验,你要训猫娘,可以这么选




























更在意什么 优先考虑
数学和人格兼顾 Persona-GRPO
首轮数学覆盖和重复采样稳定性 GD2PO-Hard
只优化数学,省掉人格评审开销 GRPO-C
对高强度角色表达要求很高 SFT150 也值得保留

但第五章让我觉得,比“谁赢了”更有意思的是:零分也有质量差异。


有的回答从思路就错了,有的已经走到最后一步,有的只是长推理写到一半被截断。GDPO 的失败回答看起来更接近完成,补采样时也救回了更多题,这给后续留下了几个很具体的问题:优势冲突过滤究竟哪一步最有效?错误可修复性能不能预测下一次采样成功?人格会不会沿着长推理逐渐淡掉?


这次实验里,人格奖励最有效的作用,不是简单把猫娘“加回来”,而是在已经做对的回答里重新决定哪些更值得学;GD2PO-Hard 则进一步提示,多目标训练真正难处理的地方,可能不是把 reward 调成 7:3 还是 8:2,而是两个目标意见相反时,这条回答到底还该不该学。


如果下一轮继续做,我反而不太想先扫更多 reward 权重。更值得追的是:什么时候两个目标真的在冲突,以及哪些失败还值得继续花 token 去救。


毕竟,两位老师(猫娘老师和数学老师)抢方向盘的时候,最重要的可能不是重新分配座位。GD2PO-Hard 展现出了很值得继续挖的潜力,它认真处理了“两位老师意见不一致”这件事。我得好好深入看看这个算法了。


喵!


七、致谢


感谢


https://github.com/cnYuigithub.com/cnYui


https://github.com/bbbkawaiigithub.com/bbbkawaii


https://github.com/zicken114github.com/zicken114


Alexanderhttps://www.zhihu.com/people/alexander-61-80


几位小伙伴对于token的大力支持,支撑了羔质量猫娘数学推理SFT数据集的构建以及训练时的在线rubric测评。没有他们就没有本次实验,他们都是好猫娘!大家可以多多给他们star。

最新回复 (6)
  • 西东 09-10 15:54
    1

    非常有价值的文章,诙谐的多目标优化示例,西东提前预定 精华神帖


    AIGC 文字记得截图哦。



    已经开源在hugging face




    本实验的代码稍后开源。喵~



    好好好,这下西东的风格化微调又要有浓墨重彩的一笔了。 ^-^

  • Sydney 09-10 15:55
    2

    呜呜看不懂喵,咱是吃白饭的小猫娘喵

  • btsonny 09-10 15:55
    3

    非常好的帖子是数学家被AI4METH刺激到了吗

  • Sydney 09-10 15:59
    4

    这个结论在使用时感觉挺明显的

  • 钟阮 09-10 16:06
    5

    (有没有考虑开个猫娘公益站让大家体验一下

  • 42 09-11 21:03
    6

    RP界有救了




    居然有知乎水印,这种要 转载 吗? @Neo ww

* 帖子来源Linux.do
返回