现在模型都是one shot 测试. 感觉和实际工作场景越来越远了

laokke 2026-09-29 09:43 1

实际上大家工作的挑战在于怎么在一坨^-^山上持续迭代,甚至无缝迁移升级。


现在的 coding agent 就缺一种这类在^-^上雕花的benchmark


我估计现在市面上的模型的分估计都不高^-^

最新回复 (2)
  • 空喵 09-29 09:44
    1楼

    oneshot才有流量

    实际工作没有吸睛点

  • llliiilll 09-29 10:47
    2楼

    所以目前后端开发模型选择,我看https://bughunt.productcompass.pm/,openai模型的优势就能显现出来。

* 帖子来源Linux.do
返回