到处都是鹈鹕骑车测试,那后端怎么测试呢?

干啥啥不行 2026-09-07 00:48 1

抖音上有个bug 挑战赛,让AI修复真实后端代码bug,一样的项目,一样的提示词,一样的agent。


有一期测试的内容是 deepseek-v4-flash 、 qwen3.8-flash、gemini3.7-flash和glm-5.3-flash。

结果是:

qwen3.8-flash 5分

deepseek-v4-flash 3分

gemini3.7-flash 3分

glm-5.3-flash 2分


glm垫底,跟论坛内的共识不一致啊。


由此引出这个问题。

最新回复 (5)
  • Eevee 09-07 00:51
    1

    鹈鹕属于一眼就看出好坏优劣了


    其他的测试就比较复杂


    首先得准备测试环境,这个环境故意去做的话,也得花点功夫


    然后是测试结果,也不好衡量


    站内有位佬,就是自己准备测试环境,项目中藏了浅层深层甚至三层bug,通过比对 AI 对 bug 的挖掘、修复、使用时长综合打分

  • chem1 09-07 00:52
    2

    问数学题目吧,比如糖果测试等等。

  • 干啥啥不行 楼主 09-07 01:10
    3

    这个我试了,糖果测试基本都能答对,看不出差距。

  • GloryDuck 09-07 01:15
    4

    不是有专业的吗 deepSWE 测评

    codex雷达站也用的这个

  • mnhorark 09-07 01:18
    5

    和我的共识是对上的,glm-5.3-flash 就是跑分区,蠢得要命这个模型^-^

* 帖子来源Linux.do
返回