Kimi K3冲上Agent榜第4,用户确认成功指标第一!

你这是违法行为 2026-07-21 15:49 1

Arena Agent 榜基于真实用户任务和工具调用记录。Kimi K3 的综合净提升为 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。


Arena 把所有参评模型均匀混合成一个虚拟平均基准,再估算换成 K3 后,各项结果改善多少。五项净提升最后取平均,得到综合分。


K3 已积累 8344 次测试会话。用户确认成功指标净提升 14.42%,排名第一。表扬多于投诉指标提升 20.62%,排名第三。它的纠错执行排名第 14,Bash 报错恢复排名第 17。K3 更容易交出让用户认可的结果,但中途改错和命令报错恢复仍是短板。



最新回复 (6)
  • wzy1 07-21 16:49
    1

    kimi 真的太慢了,经常过度思考,gpt 活都干完了,他还在思考

  • 你这是违法行为 楼主 07-21 16:50
    2

    算力不够导致的吧,刚开始没有看到有人反应,后面出圈之后就开始出现不能用,慢的情况了

  • 翠花上酸菜 07-21 16:55
    3

    kimi可能就是谷歌想象中的3.5pro吧,前端很强,后端也在第一梯队

  • kutcr 07-21 16:57
    4

    没想到kimi是第一个问鼎的国产模型

  • Sokeu 07-21 16:59
    5

    先让kimi花1小时出个前端mvp,能省下来今后好几天和gpt肘前端的时间。

  • 那个男人 07-21 17:05
    6

    不得不承认这个模型的能力,但是它的价格和它输出的价值好像性价比不太优秀

* 帖子来源Linux.do
返回