cognition 推出 swe-2 基于 kimi k3

briandevcontrol 2026-09-10 23:43 1

Cognition(Devin / Windsurf) 推出 SWE-2 模型。


SWE-2 在 Kimi-K3 上进行了后训练。


在 FrontierCode 上,SWE-2 达到了 50.0% 的得分,击败了 SWE-1.7、Grok 4.6 和 GPT 5.6 Sol。


SWE-2 今天已在 Devin 的桌面版和 CLI 版本中可用。下个月会为所有 Pro、Max 和 Teams 订阅用户免费提供。


介绍 SWE-2






最新回复 (17)
  • 初九猫 09-10 23:46
    1

    老实讲,我已经有点不太相信deepswe分数了,TERMINAL-BENCH 4.0不都已经出来了吗,为啥还测的是2.1

  • briandevcontrol 楼主 09-10 23:48
    2

    今晚会测 swe-2 参考 GitHub - getaskclaw/amber: 琥珀式封存历史回放评测(AMBER):封进琥珀,重做当时的题 —— 真实事件回放、物理封存、预注册评分的方法规范 · GitHub

  • AutoMataPascal 09-10 23:49
    3

    这俩榜全刷烂了能不能测点新的

  • briandevcontrol 楼主 09-10 23:50
    4

    期待一下 AMBER 测试(私有数据) ^-^

  • TomMao23 09-10 23:52
    5

    别的不说,基于k3后训练,如果能像现在glm5.2和swe1.7这样几乎不限量免费的话,那devin pro订阅可太值了

  • youer 09-10 23:55
    6

    像现在glm5.2和swe1.7这样几乎不限量免费



    已经很值了,现在经常蹬到断连,我都有点怕devin亏太多了(

  • 冬思韦 09-10 23:55
    7

    话说下个月开始Pro免费是多久开始呀

  • zzz26 09-10 23:56
    8

    官方说下个月付费用户可以免费使用 不过他们的ide优化很烂 占用内存很高

  • backrunner 09-10 23:58
    9

    总算可以不用忍受Kimi小家子气的额度和GPT的无限降智了吗

  • ikb 09-10 23:59
    10

    现在不就是免费的吗?


  • 冬思韦 09-11 00:01
    11

    效果怎么样蹲一下好用的话明天冲个Pro

  • zerohh 09-11 00:02
    12

    依旧kimi-k3国模雷霆大思考。138s(首字时延 5199 ms | 每秒 96 tokens)

    依旧长下文越多推理越慢。

    使用SWE-2-max强度(262K拉完了)

    (啥阴间蒸馏claude了)





    正确,这几把算不对吃屎吧









    话说下个月开始Pro免费是多久开始呀



    现在就能用免费swe2了(可能是配置错误【好几次这种配置错误情况】)






    还有就是codex反代出来的思考是摘要(官方)的,api却不会(devin2api的luna也是雷霆大思考)。

    pro付费比商汤的天天429要好,但是阉割了1M就很垃圾了啊。grok4.6都有500K。


    K3本身就是刷榜怪,再后训练,和没训练一样 ^-^

  • jue 09-11 00:03
    13

    多少上下文,之前的swe1和glm5.2 免费的感觉效果都不行

  • ikb 09-11 00:04
    14

    慢,卡。免费的东西不用太期望。

  • zzz26 09-11 00:12
    15

    上下文只有262k感觉不够啊

  • Q A 09-11 00:24
    16

    基于K3后训练的话,达到这个成绩不奇怪了

  • 朱慧月 09-11 00:43
    17

    怎么swe-2 403 但是 swe-2-max 没事

* 帖子来源Linux.do
返回