今天又有新模型,拿手上有的官方渠道做了一波横评(GLM 5.3,Claude Fable,DeepSeek V4 Pro等)

Ken 2026-08-14 18:27 1

最近刚好在给一个有一定体量的需求做code review,就拿各模型来试试啦。


环境都是claude code,prompt是cc自带的/review


省流版


以下是评测报告,由于AIGC所以是截图内容











最新回复 (4)
  • Ken 楼主 08-14 18:28
    1

    minimax这个分数我反正是没想到的

  • 马飞 08-14 18:46
    2

    请问一下佬,用是什么模型来对这些测评模型进行测评的呢?

  • Ken 楼主 08-14 18:49
    3

    为了试glm5.3,先用5.3做的审查。最终结论是Fable结合人工出的。

  • Ken 楼主 09-02 08:19
    4

    @novenia 回应一下你的小火箭:控制变量,单纯比较模型本身。

* 帖子来源Linux.do
返回