一些新模型的测试结果(包含Kimi K2.7 Code)

坐忘 2026-06-12 22:29 1

先说感受吧:



  1. kimi-k2.7-code 75分:原地踏步,不过速度快了不少,以前的版本是真慢。

  2. grok build 0.1 25分:被寄予厚望一统天下,却表现拉跨。好在版本号起的好,0.1,仍然是御三家的最大挑战者。

  3. composer 2.5 55分:虽然在kimi k2.5的基础上额外训练和强化学习,但还是没超过k2.6。

  4. MAI-Code-1-Flash 5分:和minimax 2.7老师坐一桌,前期太依赖OpenAI,起步晚了。


以下是祖传bug新增测试结果:



  • kimi-k2.7-code: 同 claude 4.6 opus(发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。)

  • grok build 0.1: 未发现问题。提示后,只解决了表面问题。(不如kimi k2.5)

  • composer 2.5: 同claude 4.6 Sonnet(发现并解决表面问题。发现深层问题,但改错了),错误相同。这一点表现不如kimi k2.6(发现深层问题,没有自动修改,能提示用户需要手动修改。)

  • MAI-Code-1-Flash: 未发现问题。错误的修改了两处不是bug的代码,不想提醒它再试一次了,和MiniMax 2.7坐一桌吧






原始测试数据

祖传bug测了几个模型的能力:



  1. minimax 2.7: 未发现问题。提示到具体代码行,仍然不承认有问题。

  2. mimo-v2-pro: 怀疑到具体行数,这个位置是对的,但最终判定不是bug。

  3. glm 5: 发现并解决问题,但只从表面上解决了。

  4. claude 4.6 opus: 发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。

  5. GPT 5.4 xhigh: 发现了用户都没想到的深层问题,自动修改,一次改对。

  6. kimi-2.5:未发现问题。然后提示代码行号,态度转变发现并解决表面问题。同时发现深层问题,但改错了。(速度很慢,比GTP还慢)

  7. Gemini 3.1 pro preview(Copilot): 同glm 5。(速度快,比其他快10倍)

  8. claude 4.6 Sonnet: 发现并解决表面问题。发现深层问题,但改错了。和kimi-2.5错的一样。

  9. glm 5.1: 同claude 4.6 Sonnet。

  10. doubao-seed-2.0-code: 同kimi-2.5

  11. qwen3.6-plus preview free: 同glm 5

  12. stepfun/step-3.5-flash^-^ 同glm 5.1。

  13. Gemini 3.1 pro (Antigravity): 发现了用户都没想到的深层问题,自动修改,一次改对。深层次问题用最少的代码修复,比GPT 5.4灵性。

  14. kimi-k2.6: 同claude 4.6 opus。

  15. GPT 5.5 xhigh: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。

  16. deepseek v4 pro (stepFun路由,思考强度未知):同claude 4.6 opus,能提示潜在问题,也分析的透彻。太慢了11分钟,26个请求,所有测试里最慢的。

  17. claude 4.7 opus max: 同claude 4.6 opus,对于潜在问题没有自动处理,提出3个选项,第一个选项是Gemini 3.1 pro (Antigravity)那个改动最少,最灵性的。耗时2分钟,15个请求。

  18. mimo-v2.5-pro: 同claude 4.6 opus。耗时2分钟。共测试4次,有2次没检查出问题,不稳定。

  19. 新增Gemini 3.5 Flash (High) (Antigravity 2.1): 未发现问题。提示到具体代码行,只从表面上解决了。速度非常快,42秒。

  20. MiniMax M3 Free: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。表现大于GPT 5.4 xhigh。

    使用的是opencode免费版,耗时7m51s。看思考过程,该想到的都想到了,不该读的文件也读了,行为和deepseek v4有点像。如果使用token plan和MiniMax code,也许速度会快点。

  21. Qwen 3.7 Max: Qoder IDE,开启Spec驱动。Max解决了表面问题。第二层深度问题提供三个方案,最好的方案和GPT 5.4相同,这点不及Opus 4.7,GPT 5.5合Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,却没有本地规避,不及GTP 5.5。是第二个发现第三层bug的老师。

  22. Qwen 3.7 Plus: Qoder IDE,开启Spec驱动。同claude 4.6 Sonnet。

  23. DeepSeek V4 Pro: Qoder IDE,开启Spec驱动。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同GPT 5.5,也是第三个发现三层bug的老师。但第二层改错了。

  24. grok build 0.1: 未发现问题。提示后,只解决了表面问题(不如kimi k2.5)。同Gemini 3.5 Flash (High),但不如它快。

  25. composer 2.5: 同claude 4.6 Sonnet(发现并解决表面问题。发现深层问题,但改错了),错误相同。这一点表现不如kimi k2.6(发现深层问题,没有自动修改,能提示用户需要手动修改。)

  26. MAI-Code-1-Flash: 未发现问题。错误的修改了两处不是bug的代码,不想提醒它再试一次了,和MiniMax 2.7坐一桌吧

  27. kimi-k2.7-code: 同 claude 4.6 opus(发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。)


最新回复 (9)
  • jameswind 06-12 22:43
    1

    谢谢佬的测评,这么看kimi新发布的k2.7-code还不错。打算用用试一试

  • yxbj 06-12 22:45
    2

    QWEN3.7MAX这么强么?

    能排4.7opus max前面?

  • yxbj 06-12 22:46
    3

    还有个问题现在antigravity能达到opus的水平么?

    差距主要在哪里?S-减的是啥?

  • ANON 06-12 22:48
    4

    粗看一眼, 非常难以认同

    (题外话, 看ID是老熟人, 上次也发过争议不小的帖子.

  • mos 06-12 22:51
    5

    qwen3.7max咋排到4.7上去的,很一般

  • ydragon 06-12 22:55
    6

    glm被你排这个后面,真的假的离谱。

  • 风遇 06-12 22:58
    7

    Kimi2.7code 用上了,速度快很多,可能是新模型,智力强了一些,额度燃烧快。然而有个android bug一直解决不了 ^-^虽然它比kimi2.6提出了耳目一新的思路和解决方案。

  • lucky_elk 06-12 23:13
    8

    QWEN3.7MAX这么强么????

  • 庄襄王 06-12 23:17
    9

    K2.7似乎有问题,幻觉严重,实际场景多次复现

* 帖子来源Linux.do
返回