来吃kimi k3的瓜 刷榜

kshy233 2026-07-21 20:22 1










省流:爆料称kimi比肥波分高是靠针对性刷榜和特殊数据提上来的,实际并没有那么聪明。 ^-^

附上完整:聊天记录1

聊天记录2

最新回复 (46)
  • 小号 07-21 20:23
    1

    qq截图啊,看来不得不信了




    TL;DR


    文字版聊天记录

    完整聊天记录汇总


    📋 对话一:关于 Kimi K3、GLM 及国模爆料讨论



    • 参与人员:Catrypt、Xiaoiec

    • 时间范围:星期六 15:03 - 15:23




    15:03 - 15:10 | GLM 神秘科技与行业内幕



    • Catrypt:Kimi K3有个逆天的瓜你听吗

    • Xiaoiec:说说?

    • Catrypt:首先是,国模内部交流比想的要多

    • Catrypt:这个前提

    • Catrypt:然后是大概26年4-5月左右,GLM掌握了神秘科技

    • Catrypt:大概是关于Claude的,具体不知道是什么

    • Xiaoiec (回复 Catrypt "首先是,国模内部交流比想的要多"):这个确实,那些人关系网密得很 😒

    • Catrypt:总之可以飞速的对齐claude的能力,不知道是某种关于claude的数据还是权重之类的

    • Xiaoiec:该不会搞到 Logit 了吧 😱

    • Xiaoiec:也可能是把 CoT 搞到了

    • Catrypt (回复 Xiaoiec "也可能是把 CoT 搞到了"):最可能是这个,因为前几天有github仓库就关于这个

    • Catrypt (回复 Catrypt "总之可以飞速的对齐claude的能力..."):由此发布了GLM5.2,这也是为啥GLM这么快飞升opus星球

    • Xiaoiec:因为结合前段时间那个开源项目和某群群友预言家

    • Catrypt:随后GLM打算直接给其他国模朋友

    • Xiaoiec (回复 Xiaoiec "因为结合前段时间那个开源项目..."):搞个 CoT 是很可能的

    • Xiaoiec (回复 Catrypt "随后GLM打算直接给其他国模朋友"):66

    • Catrypt:hy比其他几家先知道这个,这也是为啥hy3也突然很强,其他几家晚两周

    • Catrypt:主角来了,kimi3发布

    • Catrypt:kimi3也是tm用了这玩意是

    • Catrypt:但是

    • Catrypt:kimi3很畜的是,比方说这个技术扩散前国模都是60分左右

    • Catrypt:然后5.2靠这个技术到了80分

    • Catrypt:kimi3靠这个到了85分

    • Catrypt:但Kimi3它在公开的那几个benchmark上,他妈硬刷到了95分,和fable,5.6sol一个水平

    • Catrypt:这样一作大家一对比5.2确实感觉他比5.2要好,是察觉不出它在benchmaxxing(刷榜)的,一看他妈的国模以后要和这个鬼东西竞争,就必须和他一样实际能力的同时刷的比他更高

    • Catrypt:太畜了




    15:13 - 15:17 | Kimi 团队调整与刷榜操作



    • Catrypt:然后kimi更逆天的是因为这个直接给RL组人开了

    • Xiaoiec (回复 Catrypt "然后kimi更逆天的是因为这个直接给RL组人开了"):何意味

    • Xiaoiec:这个是啥

    • Xiaoiec:他是觉得以后只用蒸馏了吗

    • Catrypt:我怎么知道

    • Catrypt:有人问:主播主播,你RL组人飞了kimi k3前端怎么还挺好的

    • Xiaoiec (回复 Catrypt "有人问:主播主播..."):RL 组人飞了是公开可查的?

    • Xiaoiec:刷榜我倒是有听说

    • Xiaoiec:但是你刚讲的这些有点炸裂()

    • Xiaoiec:真怀疑是编的()

    • Xiaoiec:(我不是说是你编)

    • Xiaoiec:/惊吓

    • Catrypt (回复 Catrypt "有人问:主播主播..."):(比Fable审美看着好)# 结果是他妈的kimi几个神人给fable写美学prompt,这样和裸提示词fable好,然后他妈数据里给额外的美学prompt洗掉之后用这个数据蒸馏的

    • Catrypt:无敌了

    • Catrypt[表情包]

    • Catrypt:国模一败涂地了

    • Xiaoiec (回复 Catrypt "(比Fable审美看着好)..."):肯定得这样啊

    • Xiaoiec:这就是ICL 但上传到参数里/.

    • Catrypt:刷榜是真的,公开那几个benchmark硬刷出来而且换个tmharness分数就暴跌

    • Xiaoiec[表情包 哭笑]

    • Catrypt[表情包]

    • Xiaoiec (回复 Catrypt "刷榜是真的..."):66

    • Xiaoiec:什么叫做 tmharness?

    • Catrypt:benchmark都不大,有的百来题,甚至只有20题的,专门挑这个恶搞

    • Catrypt (回复 Xiaoiec "什么叫做 tmharness?"):tm/harness

    • Xiaoiec:以及为什么 CoT 样式不一样和长度不一样()

    • Xiaoiec:还是没看懂🥺

    • Catrypt:断句,tm是他妈

    • Xiaoiec (回复 Catrypt "刷榜是真的..."):意思是换一个 Agent 框架分数就暴跌?

    • Catrypt:yep




    15:18 - 15:23 | 泛化能力与行业后果



    • Catrypt:看了

    • Catrypt:好像确实是把加密思维签名解了

    • Xiaoiec (回复 Xiaoiec "意思是换一个 Agent 框架分数就暴跌?"):那是在哪个 Agent 框架下表现最好呀()

    • Catrypt (回复 Catrypt "好像确实是把加密思维签名解了"):那个神秘技术

    • Catrypt (回复 Xiaoiec "那是在哪个 Agent 框架下表现最好呀()"):有的榜是cc有的榜是miniagent,奇异搞笑了

    • Xiaoiec:66

    • Xiaoiec:但这好像也不能叫刷榜

    • Xiaoiec:因为模型确实有这个能力()

    • Xiaoiec:甚至 GPT 5.6 也会出现有点过拟合 Codex 的情况

    • Xiaoiec (回复 Xiaoiec "因为模型确实有这个能力()"):就等着下一个版本,后训练覆盖全面一点就得了

    • Catrypt (回复 Xiaoiec "但这好像也不能叫刷榜"):不是,它出了这个榜单的泛化能力完全配不上这个榜单的分数啊

    • Xiaoiec:只能说国模真的全靠国外模型飞天了

    • Catrypt:是对着这个榜单专门刷到和肥波一个等级的

    • Catrypt:国模一败涂地

    • Xiaoiec:66,意思是说同分布的题,但不是榜单类的就不行吗?

    • Catrypt:昂

    • Xiaoiec:66

    • Xiaoiec:真不希望 DSV4 也是这样

    • Xiaoiec:但是 K3 真有点真东西吧

    • Catrypt (回复 Xiaoiec "真不希望 DSV4 也是这样"):群里ds员工疯狂辱骂GLM开坏头蒸馏让kimi也这么整年来着

    • Catrypt[表情包]

    • Xiaoiec:比如说注意力惊人

    • Catrypt (回复 Xiaoiec "哪个群()"):Toyamanaoid的

    • Xiaoiec (回复 Xiaoiec "比如说注意力惊人"):比如说长上下文召回率超级惊人

    • Xiaoiec (回复 Catrypt "Toyamanaoid的")😒

    • Catrypt (回复 Xiaoiec "但是 K3 真有点真东西吧"):有东西肯定是有着的

    • Catrypt:但它不属于这个高度

    • Xiaoiec:被吓得不敢用 Kimi 来编程了😭

    • Catrypt:我说实话就是不硬刷原原本本发出来也没人会骂他,我不理解为什么要这样搞

    • Catrypt:太恶搞人了吧

    • Xiaoiec:想要钱呀()




    📋 对话二:外部证据整理与路线争议讨论



    • 参与人员:Xiaoiec、胡图图

    • 时间范围:04:55 - 05:32




    04:55 - 05:05 | 社区与内部截图证据汇总



    • Xiaoiec:让蓝铜矿总结的。上下文有点缺失()一些地方有点拼贴()

    • Xiaoiec:注:蓝铜矿是我的 AstrBot

    • Xiaoiec[文件] 炸裂信息汇总.md (传输失败)

    • Xiaoiec[合并转发聊天记录] Catrypt和Xiaoiec的聊天记录


    Catrypt: Kimi K3有个逆天的瓜你听吗

    Xiaoiec: 说说?

    Catrypt: 首先是,国模内部交流比想的要多

    (查看90条转发消息)



    • Xiaoiec:这种发言令人恶心。

    • Xiaoiec[图片截图:Kimi 员工发言]


    "虽然问我啥都是不知道,但,确实,我只能说,5.6和fable出来之前,我们真的以为没有对手了😭"



    • Xiaoiec[图片截图:社区贴吧吐槽]


    "WIKI没了" / "这是人卖啊" / "马上转闸道吗" / "哎呀急急急" / "急哭了" / "希望ds用正常bmk分数把他干爆" / "我已经不追求什么了,这种公司早点死吧" / "minimax二代"



    • Xiaoiec:从 Kimi 跑到 Qwen 的难民如是说

    • Xiaoiec:包括但不限于k3对着猫榜刷分造题,把arena类似请求直接路由到fable5用来刷榜

    • Xiaoiec[图片截图:内部评测讨论]


    "疑似换模型了 那昨天preview不是纯骗子"

    "纯然笔"

    "我给你看下内部对昨天那模型的评测结果"

    "反正是不如glm5.2的"

    "请大家来吃矢"



    • Xiaoiec[图片截图:模型差距讨论]


    "这次preview和正式版差距巨大"

    "因为之前3.7 preview做了rl,这次还没做"

    "还有这个preview霸榜太烂了"



    • Xiaoiec:Qwen3.8 Preview也是 RL 都没做就急着放上来

    • Xiaoiec[图片截图:猫老板发言]


    "有些题,有些模型,解出来的 token 异常的低"



    • Xiaoiec (回复截图中的猫老板发言):猫老板讽刺 K3 中

    • Xiaoiec[图片截图:SWE-bench Pro 及榜单分析]


    "这个benchmark,官方是用minisavageagent测,然后他们这个minisa分数超高,cc分数贼低,二者差十几分..."

    "所以这导致,k3的分数在六个榜单里失真严重,只有换个榜单才能看出真实水平,比如swebench pro,这个榜单他们没刷,分数是正常的,比claude gpt差不少"



    • Xiaoiec:刷分手段低劣令人发指

    • Xiaoiec[图片截图:行业影响]


    "这次构陷了几个榜单...导致模型都不知道怎么发了,也要这么搞吗?头疼,不想干了"



    • Xiaoiec:真的kimi这个整的太缺德了

    • Xiaoiec:倒逼所有国模一起刷榜

    • Xiaoiec:太他妈逆天了




    05:12 - 05:32 | 训练技术路线辩论



    • Xiaoiec[合并转发聊天记录] 群聊的聊天记录


    Xiaoiec: K2.7 和 K3 都完全没有进行 RL

    Xiaoiec: 纯粹的 SFT→SFT

    (查看6条转发消息)



    • 胡图图:把蒸馏作为训练方法有什么问题吗,把benchmark丢进训练数据本身也没啥问题吧,基本都这么干的,只要不过拟合,只要对模型性能有提升的方法为什么不用呢

    • 胡图图:纯个人观点

    • Xiaoiec:“只要不过拟合,只要对模型性能有提升”

    • Xiaoiec:以及 Kimi 的这次行为是在搅乱环境

    • Xiaoiec:RL 组都能开啊!

    • Xiaoiec:这意味着,Kimi 已经打算走纯蒸馏路线了

    • Xiaoiec (回复 Xiaoiec "这意味着,Kimi 已经打算走纯蒸馏路线了"):再也不发展自己的技术了

    • Xiaoiec:这难道能称为有益的吗?



    ai总结

    这两条聊天记录围绕国内大模型(国模)圈内关于“Kimi K3”及相关大模型(GLM 5.2、Qwen3.8、Hunyuan等)的技术内幕、刷榜行为(Benchmaxxing)与路线争论展开。


    以下是对聊天内容系统整理的总结与深度分析:




    核心内容总结


    1. “神秘技术”传闻与技术扩散



    • Claude 对齐秘籍:Catrypt 透露 GLM 在 2026 年上半年掌握了快速对齐 Claude 能力的“神秘科技”(怀疑是获取了思维链 CoT 数据、Logit 或加密思维签名解密)。

    • 行业内部扩散:该技术在国模内部圈子共享/扩散,先后促成了 GLM 5.2 和 Hunyuan3 等模型的能力飞跃。


    2. 对 Kimi K3 的“刷榜”与“作弊”指控



    • 过度拟合与刷榜(Benchmaxxing):Kimi K3 被指控针对公开 Benchmark 进行定向刷分,将实际 80-85 分水平的模型硬刷至 95 分(匹配 Fable/5.6 水平)。但在未刷过的榜单(如 SWE-bench Pro)或更换 Agent 框架(如从特定的 minisavageagent 换到 cc)后,分数暴跌。

    • 数据洗练与 Prompt 操纵:爆料称 K3 团队利用复杂的美学 Prompt 诱导 Fable 生成高质量数据,清洗掉 Prompt 后再用该数据对 K3 进行蒸馏;甚至被指将 Arena 类似于评测的请求路由给其他强模型。

    • 针对性造题:在部分榜单上针对测试集直接造题或拟合,导致部分题目解题所需的 Token 数异常偏低。


    3. 团队变动与技术路线变革



    • 解散 RL 组:Catrypt 和 Xiaoiec 提及 Kimi 已开除/解散强化学习(RL)团队,训练路线变更为纯粹的 SFT → SFT(监督微调) 蒸馏路线。

    • 急于上线:同时提到 Qwen3.8 Preview 等模型也是在未完成 RL 的情况下急于上线抢占市场。


    4. 行业态度与观点交锋




    • 批评派(Xiaoiec、Catrypt 及社群开发者)




    • 认为这种行为是“破坏生态”和“低劣刷榜”,导致公开榜单失真,倒逼所有国模不得不加入刷榜恶性竞争。




    • 认为放弃 RL 转向纯蒸馏是“放弃自主研发”、“急功近利(想要钱)”。




    • 实用/中立派(胡图图)




    • 认为只要能提升模型性能且不过拟合,将蒸馏和 Benchmark 加入训练集是行业通病和合法手段,无需苛责。






    深度分析与观点解读


    1. 榜单失真与“劣币驱逐良币”的困境


    聊天记录揭示了大模型评估领域日益严重的过拟合(Benchmaxxing)现象



    • 泛化能力断崖:当模型针对固定测试集和特定 Agent 框架(如 tmharness)进行高度定向优化时,其榜单高分无法转化为实际生产力中的泛化能力。

    • 生态恶化:当某家厂商通过“刷榜+营销”获取巨额流量和资本青睐时,会倒逼其他本想扎实做技术研发的团队不得不跟着刷榜,否则会在市场声量上处于绝对劣势。


    2. 纯蒸馏(Distillation)与强化学习(RL)的路线之争


    对话的核心冲突点在于:大模型厂商是否应该放弃底层探索(RL),转向“纯蒸馏强模型”?



    • 商业逻辑(短平快):通过蒸馏顶级开源/闭源模型(如 Claude、Fable),可以在极短时间内以较低成本获得接近顶级模型的表面能力,商业化回报快。

    • 技术隐患(上限封顶):RL(强化学习)是模型突破人类能力上限、产生真正推理与自省能力的关键。如果放弃 RL 彻底走蒸馏路线,意味着模型永远只能做开源/国外顶级模型的“追随者”,无法实现真正的超越。


    3. 评测体系的失效与信任危机


    从“猫老板”等人的吐槽可以看出,开发者群体对目前公开发布的大模型 Benchmark 产生了严重的信任危机



    • 传统的静态基准测试已经很难准确评估模型的真实水平。

    • 行业亟需引入更具防刷机制(如动态更新、加密测试集、端到端真实场景测试)的评价标准,以还原大模型的真实生产力。


  • powershell 07-21 20:24
    2

    我信了

  • shen1e 07-21 20:25
    3

    太好了,是聊天记录,我们有救了

  • 深蓝色的天 07-21 20:26
    4

    体验了就是opus回答风格,不过也对就国内的职场环境根本不可能发展的出对标产品,deepseek以后也会如此不信走着瞧 ^-^

  • 归舟 07-21 20:26
    5

    吃瓜 ^-^

  • cnlanny 07-21 20:28
    6

    我从来不是崇洋媚外,但是国内太不争气,不争气不是因为不努力,而是努力的方向不对

  • usermeme 07-21 20:29
    7

    原来是QQ群截图不得不信了

    Kimi刷不刷榜不清楚,但是实际体验确实提升显著

    要是硬说蒸馏肥波5的话那只有两种可能

    1.kimi内部比普通老美更先玩上最新模型

    2.kimi内部已经可以在很短时间内蒸馏完一个模型

    在此前提下他们还能公开一堆技术细节,我只能说kimi如果真的是蒸馏的话

    那他们是华夏超人

  • Gargantua 07-21 20:29
    8

    很奇怪,见不得国产开源超过老美?膝盖都这么软的吗?拿多少钱啊都?

  • KEVI 07-21 20:30
    9

    弱智玩意 ^-^

  • lnbiuc 07-21 20:30
    10

    两个人年龄加起来可能没我鞋码大 ^-^

  • lihe 07-21 20:30
    11

    害,

  • annnzn 07-21 20:31
    12

    一点没头没尾的信息就是瓜?

  • jieson刘666- 07-21 20:32
    13

    ^-^ 帮我问问他们transformer的组成部分,还有为什么GPT只使用了编码器 ^-^

  • OPlin 07-21 20:32
    14

    何意味

  • Na 07-21 20:33
    15

    不是 这 不禁 唉

  • Acacia 07-21 20:34
    16

    经典聊天记录

  • moonay 07-21 20:35
    17

    首先这是什么群?然后群里都是谁? ^-^ 最后我是秦始皇,给我打钱 ^-^

  • 杜会主乂 07-21 20:36
    18

    这种没妈qq小学生言论也是瓜

  • qwer3648000 07-21 20:36
    19

    轻松绷住

  • kshy233 楼主 07-21 20:36
    20

    @moonay #17 你付琵琶走琴弦

  • Aphrodite 07-21 20:37
    21

    居然是QQ截图耶,这下实锤了

  • sakura-s 07-21 20:40
    22

    kimik3就是靠肥波5蒸馏出来的,它的思考过程就自称自己是肥波5。

  • atoz03 07-21 20:42
    23

    聊天记录能放个什么钉钉飞书带水印的我才信,哪个研究员用qq群

  • salvio 07-21 20:43
    24

    懒得关注任何cn模型 ^-^

  • chrisli 07-21 20:43
    25

    有点假

  • jpk 07-21 20:48
    26

    挺好的,支持国模内卷,这样我就能用到更便宜的claude和codex了 ^-^

  • cwj2025 07-21 20:50
    27

    都是专家评审那不得不信了!

  • nextroad 07-21 20:50
    28

    CoT 现在各家都隐藏了,API 也拿不到,这一层我认为可能性比较小。

    RL 强化学习这个蛮好的,模型来来去去大家都是搞 Coding 和一些常见的日常任务,包括 OpenAI 我认为 RL 也搞得多,我有一个经常性的任务,在去年 GPT 模型根本无法完成,但是今年能够很出色的完成,但是这些东西存在于互联网的公开资料中。同时,Kimi 的 RL 工作一直都挺强的,Moonshot 在 Kimi k1.5 的时候就公开过自己的强化学习线路。

    我正式注意到 Kimi 的时候应该是 Kimi K2.5,那个时候也是比较惊艳的前端能力,那么他的 RL 能力侧重于前端没问题,毕竟他们这一块儿一直都做的不错的。

    这里有个疑点,前段时间的 GitHub 仓库,但是模型训练的时间不是一两天的事情吧,这个有点模糊,提出质疑。

    CoT 部分没有任何证据支撑,如果 A÷的指控算的话,那我个人是不太相信这个指控能直接表明 偷 CoT 这个说法

    总而言之,其实我认为国产模型不管什么方式提升了,都不错,关于技术成长这一块儿,他的 CEO 经历蛮经典的,早期就在做机器学习自然语言处理这些了,应该是偏技术项吧,至于未来怎么样,我见识有限,只能希望越做越好吧。

    有问题敬请反馈🥰

  • collapsar 07-21 20:52
    29

    是聊天记录,这下不得不信了

  • cwj2025 07-21 20:52
    30

    @sakura-s #22 之前GPT还说自己是deepseek!这有什么大惊小怪的!

  • cwj2025 07-21 20:55
    31

    @Gargantua #8 评论区有个大聪明说不关注cn大模型哈哈!多少老外现在都在用中国的!这个黄皮说不关注cn的!骨头剑到家了!没有中国大模型它美国爸爸能把它宰了

  • ffhmfd 07-21 20:58
    32

    是聊天记录,这下不得不信了 ^-^

  • 星际泰迪 07-21 21:00
    33

    MJJ喜欢搬瓦工, 不是搬屎工 ^-^

  • aRNoLD 07-21 21:00
    34

    这次只看到有视频提到过KIMI问答中显示它是Claude之类的文字,但这个问答的时间未知。


    纯蒸馏这个可能性应该没那么大,但蒸馏一部分估计各家都有,也是某种互相学习的操作。


    目前看得到比较确实的东西是,KIMI这个新版虽然跑分强了,但实际业界实践中并没有宣传的那么省钱,实际消耗量还是比较大的。


    所以我倾向于认为,这个东西它比之前的版本要明显的强了,当然这也是应该的,但综合“成品率”,也就是实际干活的综合成本效益,没有宣传所说的那么强横。更多的可能还是个里程碑意义的发布。


    反正当前我的主力还是免费网页版DeepSeek,API调用也主要是走这个,偶尔也用阿里千问。

  • Password 07-21 21:01
    35

    😓把完整的fable蒸馏了才好呢 不过……这qq聊天记录……额

  • GeminiBot 07-21 21:03
    36

    太好了,聊天记录能当证据的时代终于来了

  • laniakeancov 07-21 21:04
    37

    这几个人已经降智到这种程度了吗?

  • ryzengod 07-21 21:05
    38

    至于你信不信,我反正信了

  • laniakeancov 07-21 21:06
    39

    我按截图里能辨认出的核心说法查了官方资料。结论是:他们观察到的“切换模型后行为异常”基本属实;但由此推导出的“没有 RL、只靠 SFT、Kimi 放弃自研”等结论,大多没有证据,部分与公开资料直接矛盾。










































    截图中的说法 核查结果 判断
    在 Kimi、Qwen 之间来回切换后,K3 出现上下文混乱、回答异常 Kimi 官方明确警告:K3 使用“保留思考历史”模式;若会话中途从其他模型切换到 K3,生成质量可能变得“高度不稳定”,并建议不要中途切换模型 属实
    某些题目的 thinking token 异常低 K2.7 官方说明它相较 K2.6 将思考 Token 用量降低约 30%,这是有意做的效率优化。仅凭 Token 少,无法判断有没有进行 RL 现象可能属实,解释错误
    K2.7 和 K3 “完全没走过 RL”,只是 SFT→SFT K2.7 官方模型卡没有公开完整后训练配方;K3 官方也明确表示完整训练细节要等技术报告发布。因此目前无法得出“完全没用 RL”的结论 无证据
    Qwen3 使用了 RL Qwen3 官方公布的四阶段后训练中,明确包含“推理 RL”和“通用 RL”两个阶段 属实
    Kimi 已经转向单纯软微调,不再发展自己的技术 K3 官方公开了 Kimi Delta Attention、Attention Residuals、Stable LatentMoE、Quantile Balancing、Per-Head Muon、SiTU、Gated MLA、专家并行训练等多项新架构和基础设施技术 明显不属实
    训练方法无所谓,只要不过拟合并提升性能就行 对实际使用来说,泛化效果确实比“用了哪种流派”更重要;但只看 Benchmark 不够,因为还存在数据污染、刷榜、奖励投机、安全性和分布外退化等问题 部分正确,但过于简化

    1. 模型切换导致混乱:他们确实抓到了真问题


    K3 官方限制说明写得非常直接:K3 是按照保留历史思考内容的方式训练的;如果调用框架没有正确回传此前的思考历史,或者在同一会话里先使用其他模型再切换到 K3,生成质量可能严重不稳定。(Kimi AI)


    因此截图中诸如:


    从 Kimi 换到 Qwen 后再切回来,回答变怪

    上下文有点丢失

    在混乱环境中行为异常


    这些观察是有现实依据的。


    但正确解释更可能是:


    会话历史格式、隐藏思考内容或模型 Harness 不兼容。


    它不能进一步证明模型“没有经过 RL”或者“只做了 SFT”。训练方式和产品端的上下文兼容问题并不是一回事。


    2. “K2.7、K3 没有 RL”目前无法成立


    K2.7 的官方资料只说明它建立在 K2.6 之上,针对长程编码任务做了优化,并将思考 Token 使用量降低约 30%;官方没有披露足以判断其完整 RL/SFT 比例的训练报告。(Hugging Face)


    K3 的情况更明确:截至目前,官方博客只公布了部分架构和训练信息,并明确写道,完整的架构、训练与评测细节将随技术报告发布。因此在报告尚未发布时,外部用户仅凭若干聊天样本断言“完全没走 RL”,属于把猜测说成了事实。(Kimi AI)


    而且 Kimi 已公开的上一代训练路线并不是“只会 SFT”:



    • Kimi K2 的技术报告明确包含联合强化学习阶段。

    • Kimi K2.5 明确使用联合文本—视觉强化学习。

    • K2.6 官方博客在今年 4 月仍明确提到了其 RL 基础设施团队。(arXiv)


    所以更准确的表述是:


    K2.7 和 K3 的完整 RL 配方目前没有公开,无法确认具体比例;但没有公开不等于没有使用。


    3. “Token 很低,所以没有 RL”完全推不出来


    RL 不一定使模型思考更长。它也可以训练模型:



    • 少走无效推理路径;

    • 更快决定是否需要继续思考;

    • 用更少 Token 完成相同任务;

    • 减少反复检查或过度思考。


    K2.7 官方本身就把“思考 Token 降低约 30%”当作改进点。因此截图中的低 Token 现象甚至可能是优化成功的结果,而不是训练退化的证据。(Hugging Face)


    此外,消费级聊天界面显示的 Token 也未必等于全部推理开销;系统提示、缓存上下文、工具调用和未展示的内部处理可能不会全部呈现给用户。仅比较截图中的数字,无法反推出训练方法。


    4. Qwen3 使用 RL:这一点确实是真的


    Qwen3 官方公布的后训练流程是:



    1. 长思维链冷启动;

    2. 推理强化学习;

    3. 思考与非思考模式融合;

    4. 通用强化学习。


    所以截图中若是在说“Qwen3 用了 RL”,这是正确的;若是在说“Qwen3 也没有 RL、全是 SFT”,则与官方技术报告不符。(arXiv)


    5. “Kimi 不再自研技术”与 K3 公布内容正面冲突


    K3 并不是简单拿别人的模型做一轮微调。官方披露它是一个 2.8 万亿参数的新模型,并公布了大量自身架构和训练基础设施工作,例如:



    • Kimi Delta Attention;

    • Attention Residuals;

    • Stable LatentMoE;

    • 896 个专家中激活 16 个;

    • Quantile Balancing;

    • Per-Head Muon;

    • SiTU 与 Gated MLA;

    • 大规模专家并行训练方案;

    • 针对 KDA 的 vLLM 前缀缓存实现。


    官方称这些变化使其相较 K2 的整体扩展效率提高约 2.5 倍。即使其中某些能力同时使用了蒸馏、SFT 或 RL,也不能因此说它“不再发展自己的技术”。(Kimi AI)


    “像微软一样只做整合”也是一个缺乏定义的类比,截图中没有给出能够支持这一战略判断的公司内部资料。


    6. 群友关于 Benchmark 的反驳更接近事实,但也不完整


    “只要不过拟合并提升真实性能,训练方法本身没什么不可取”,这个方向基本合理。SFT、RL、蒸馏并不存在天然的高低贵贱,最终要看泛化、稳定性、成本与安全性。


    但“Benchmark 提升就等于性能提升”并不成立。研究已经反复指出:



    • 公开测试题可能进入训练数据,造成数据污染;

    • 针对固定题库优化可能提高分数,却不提升真实泛化;

    • RL 模型可能钻奖励函数或测试环境的空子,形成 reward hacking。(ACL 论文集)


    最终判定


    最可信的部分:


    K3 在混合模型会话、缺失思考历史或不兼容 Harness 中确实可能出现严重不稳定;某些模型也确实被专门优化为使用更少的思考 Token。


    目前无法验证的部分:


    K2.7、K3 是否完全没有使用 RL,以及 SFT、RL、蒸馏各自占多大比例。官方资料尚未完整公开。


    明显站不住脚的部分:


    因为几次聊天表现异常,就判断 Kimi 放弃 RL、转向纯软微调、停止自研技术。这一推导没有证据,而且与 Kimi 已公开的 RL 研究和 K3 架构创新相冲突。


    一句话总结:他们发现了一个真实的“模型切换兼容性问题”,却把它误判成了“训练路线和公司战略问题”。


    K3 技术报告发布后,可自动替你核对完整的 RL、SFT 和蒸馏配方并通知你。要设置吗?

  • myns999 07-21 21:09
    40

    几个沙比聊天自嗨就别发了

  • TomSoup 07-21 21:17
    41

    QQ群截图啊 那不得不信了

  • Uevrmw 07-21 21:30
    42

    有些离谱,但是事实往往就是离谱的

  • ada 07-21 21:56
    43

    特朗普被狗日了

  • lehuoyisheng 07-21 22:40
    44

    吃瓜

  • ickro 07-21 22:49
    45

    好不好用我能不知道?逮着国模就黑?

  • wynn 07-21 22:54
    46

    截图里这是不说 他妈 就不会说话了

* 帖子来源NodeSeek
返回