从去年3月到现在我一直在用AI开发,各个模型多少都用过点,但是无论什么平台对模型的好用/不好用的评价有明显一边倒的情况(不局限于l站,b站和x也都是这样)
有些人不管用没用过某个模型都要跟风评价一下,并且还要去反驳那些用过的人的真实体验分享
举几个例子 大致按时间排序下,顺序不一定准:
- gpt5不好用 不如sonnet4.5
- Gemini2.5Pro这么猛 3Pro肯定更猛
- gpt5.2不行吧,弄完一堆报错 opus4.5强多了
- 感觉opus4.6比gpt5.3 5.4强多了
- deepseek性价比很高的,价格比国外模型低多了[PS:是我同学,而且是v4没打折的时候说的 当时gpt各种羊毛/号池]
- MiniMax/Qwen刷分
- gpt5.4黑话多
- gpt的ui不行
- Gemini就剩前端和快了
- xxx拉完了(糖果题)
- xxx神了 吊打xxx(网页小游戏oneshot)
- V4Pro灰度 超越fable
有些“拉完了” “震惊瘫坐”的模型都不是说多差或者多完美 包括现在很多人说xxx模型刷分 xxx模型跑分王,都纯属没有依据的情绪表达,单纯觉得分高+oneshot效果看着一般那就肯定是刷分的 还有一些人迷信测试题榜单(竞技场 SWE AA DeepSWE),导致看到所谓“权威测试”出现离谱结果的时候完全无法接受 (比如x上面一堆人在astra的AA分数和5.6sol一样的时候说AA是“诈骗榜单”,又说DeepSWE几个分高的模型都是Benchmaxxing)
个人体会
GPT5
去年我参加Geekgame2025(CTF比赛),我是纯兴趣没比赛经验,其中大部分题目都是靠ai辅助分析
其中有道题实在做不出来,给能用到的模型全试了一遍(Sonnet 4/4.5 Opus4.1 Gemini2.5 pro deepseek r1 gpt5 gpt4o gpt4.1 o4-mini)试到最后只有gpt5给了正确思路并且自行验证没问题算出答案了,opus4.1和sonnet都告诉我问题不可能解决
虽然gpt5的代码不行,但是分析问题的时候推理很细致考虑很全面,有的人就只看跑分,一直和我说claude好用 gpt不行,用就是浪费额度(后面又猛吹opus4.6 ,5.4出来之后又改吹gpt了)
GPT5.2
还有一个印象比较深的就是gpt5.2,虽然对话一般但是前端相比同期模型超前的强
虽然5.4 5.5很多人都说前端不行 但是5.2我用来复刻网站,把他反代出来接到claude code里面,结果同样的任务效果比claude自己的4.5系列要好很多(4.5系列一次提示词还做不到样式完整能访问功能能用 4.6进步倒是巨大) 相比当时国模最强(也许是吧)的glm4.7强更多了
具体任务大致就是:
参考站点A(链接)的风格,为项目XXX(工作目录)重新设计一个用户前端,将前端与测试环境中真实api对接后使用Playwright测试所有功能,确保所有功能可用
结果还真没啥问题(没有后续模型的提示词写在页面的问题并且很完善),第一次就可以正常使用大部分功能(登录 注册 商品展示 购买 服务状态监控 工单),只是缺了几个小页面 ,一共花了差不多三天时间让它补全页面 补全多语言 调整样式之后就全都做完了,这玩意从去年一直用到现在,中间就改过几次接口样式还是很好看
另外5.2我印象比较深刻的原因就是有个用claude的说openai刷分然后swe还是terminalbench2超过了opus4.5


Gemini 3.x flash/Muse Spark 1.x
然后就不得不提一下gemini和musespark,说Gemini flash和musespark刷分的人有多少是没带偏见的? 如果只靠“面向测试训练”这么简单就能在这么多“权威”榜单排前几甚至拿第一我觉得不会其他所有厂商都那么傻不会学 huggingface上有很多微调模型喂了大量的测试集和高级模型的蒸馏数据,也没见有多少测评分数能超过原版成绩的(诚然拿测试题直接训练确实可以提高一部分测试成绩但是其余的测试比如长上下文捞针还有知识类任务又更差了)
3.8flash虽然有token量爆炸/乱改项目/前端退步这些问题,但是确实和跑分结果一样找问题的能力提高了,在修复指定功能的时候可以一次修好了,这些都是3.7或者是某些体感“更强”的模型做不到的(比如glm5.3flash)
musespark虽然前端不行 复杂任务不会干,但是在zcode里面测试给一个从外部网站api导入几千条数据到项目并正确归类的任务都能够按要求全部正确完成,不像gemini出幻觉给我一堆假模型,glm5.3让它导三层内关联的数据但是只导入了几十个,这些都是实打实的模型能力
如果你认为某个模型“刷分”或者Benchmaxxing那最起码得自己深度试一下而不是看到分数就在那说模型“刷分”吧 如果分数虚高就是刷分,那刚出的dsv4.1flash超过自己pro算不算刷分 glm5.3flash部分测试超过5.3算不算刷分?
另外对于测试,如果测试不能反映模型真实水平并且多次出现问题那只能说明测试本身就需要优化调整,而不是去说模型厂商刷分,又或者说榜单是收钱了/假数据
像是terminalbench arcagi就一直在更新自己的测试题,一年都出了好几个版本,还有一些用户评价的elo榜单比如voxelbench(测试模型生成的mc建模能力)或者竞技场也都可以参考一下(但是竞技场也不是没有改对比权重从而提高胜率的先例 比如之前某些模型刚上线分数很高甚至第一过一段时间掉下去之类的)
编码能力测试的一些反例
视觉能力测试虽然比较少,但是可以看出来gemini和gpt的视觉推理甚至不推理的能力都超过目前很多跑分前沿的国模
比如之前有佬友发的
[6408032f98ebfaa0b3d3dcd709caa4b9]
答案是1996
目前看答对的国模有
Qwen3.8-Max
豆包 2.1turbo
GLM 5.3 Flash
Gemini和gpt甚至不开思考或者instant模式都能秒答对,但是这么多排行榜在顶前面的国模只有

能答对,都觉得智商低的豆包2.1turbo和pro也答对了,被认为“刷分”的qwen3.8max musespark1.3和Gemini3.8flash也都能答对 这是不是又和一些人的直觉感受不一样呢
小结
希望能看到这里的佬友讨论模型能力的时候都能实事求是,自己体验之后客观评价,不要迷信各种“榜单”,也不要跟着大部队跟风对模型情绪输出
至于模型降智/厂商封号那些是厂商运营或者态度问题,不能代表模型本身能力,可能对于订阅来说有参考性,但是对于希望真的在项目中运用模型的人是完全没有帮助的