对于大模型的评价应该少点偏见(刻板印象)和情绪输出

SwiftUI 2026-09-11 00:28 1

从去年3月到现在我一直在用AI开发,各个模型多少都用过点,但是无论什么平台对模型的好用/不好用的评价有明显一边倒的情况(不局限于l站,b站和x也都是这样)


有些人不管用没用过某个模型都要跟风评价一下,并且还要去反驳那些用过的人的真实体验分享


举几个例子 大致按时间排序下,顺序不一定准:



  • gpt5不好用 不如sonnet4.5

  • Gemini2.5Pro这么猛 3Pro肯定更猛

  • gpt5.2不行吧,弄完一堆报错 opus4.5强多了

  • 感觉opus4.6比gpt5.3 5.4强多了

  • deepseek性价比很高的,价格比国外模型低多了[PS:是我同学,而且是v4没打折的时候说的 当时gpt各种羊毛/号池]

  • MiniMax/Qwen刷分

  • gpt5.4黑话多

  • gpt的ui不行

  • Gemini就剩前端和快了

  • xxx拉完了(糖果题)

  • xxx神了 吊打xxx(网页小游戏oneshot)

  • V4Pro灰度 超越fable


有些“拉完了” “震惊瘫坐”的模型都不是说多差或者多完美 包括现在很多人说xxx模型刷分 xxx模型跑分王,都纯属没有依据的情绪表达,单纯觉得分高+oneshot效果看着一般那就肯定是刷分的 还有一些人迷信测试题榜单(竞技场 SWE AA DeepSWE),导致看到所谓“权威测试”出现离谱结果的时候完全无法接受 (比如x上面一堆人在astra的AA分数和5.6sol一样的时候说AA是“诈骗榜单”,又说DeepSWE几个分高的模型都是Benchmaxxing)


个人体会


GPT5


去年我参加Geekgame2025(CTF比赛),我是纯兴趣没比赛经验,其中大部分题目都是靠ai辅助分析

其中有道题实在做不出来,给能用到的模型全试了一遍(Sonnet 4/4.5 Opus4.1 Gemini2.5 pro deepseek r1 gpt5 gpt4o gpt4.1 o4-mini)试到最后只有gpt5给了正确思路并且自行验证没问题算出答案了,opus4.1和sonnet都告诉我问题不可能解决

虽然gpt5的代码不行,但是分析问题的时候推理很细致考虑很全面,有的人就只看跑分,一直和我说claude好用 gpt不行,用就是浪费额度(后面又猛吹opus4.6 ,5.4出来之后又改吹gpt了)


GPT5.2


还有一个印象比较深的就是gpt5.2,虽然对话一般但是前端相比同期模型超前的强

虽然5.4 5.5很多人都说前端不行 但是5.2我用来复刻网站,把他反代出来接到claude code里面,结果同样的任务效果比claude自己的4.5系列要好很多(4.5系列一次提示词还做不到样式完整能访问功能能用 4.6进步倒是巨大) 相比当时国模最强(也许是吧)的glm4.7强更多了


具体任务大致就是:



参考站点A(链接)的风格,为项目XXX(工作目录)重新设计一个用户前端,将前端与测试环境中真实api对接后使用Playwright测试所有功能,确保所有功能可用



结果还真没啥问题(没有后续模型的提示词写在页面的问题并且很完善),第一次就可以正常使用大部分功能(登录 注册 商品展示 购买 服务状态监控 工单),只是缺了几个小页面 ,一共花了差不多三天时间让它补全页面 补全多语言 调整样式之后就全都做完了,这玩意从去年一直用到现在,中间就改过几次接口样式还是很好看


另外5.2我印象比较深刻的原因就是有个用claude的说openai刷分然后swe还是terminalbench2超过了opus4.5




Gemini 3.x flash/Muse Spark 1.x


然后就不得不提一下gemini和musespark,说Gemini flash和musespark刷分的人有多少是没带偏见的? 如果只靠“面向测试训练”这么简单就能在这么多“权威”榜单排前几甚至拿第一我觉得不会其他所有厂商都那么傻不会学 huggingface上有很多微调模型喂了大量的测试集和高级模型的蒸馏数据,也没见有多少测评分数能超过原版成绩的(诚然拿测试题直接训练确实可以提高一部分测试成绩但是其余的测试比如长上下文捞针还有知识类任务又更差了)


3.8flash虽然有token量爆炸/乱改项目/前端退步这些问题,但是确实和跑分结果一样找问题的能力提高了,在修复指定功能的时候可以一次修好了,这些都是3.7或者是某些体感“更强”的模型做不到的(比如glm5.3flash)

musespark虽然前端不行 复杂任务不会干,但是在zcode里面测试给一个从外部网站api导入几千条数据到项目并正确归类的任务都能够按要求全部正确完成,不像gemini出幻觉给我一堆假模型,glm5.3让它导三层内关联的数据但是只导入了几十个,这些都是实打实的模型能力

如果你认为某个模型“刷分”或者Benchmaxxing那最起码得自己深度试一下而不是看到分数就在那说模型“刷分”吧 如果分数虚高就是刷分,那刚出的dsv4.1flash超过自己pro算不算刷分 glm5.3flash部分测试超过5.3算不算刷分?


另外对于测试,如果测试不能反映模型真实水平并且多次出现问题那只能说明测试本身就需要优化调整,而不是去说模型厂商刷分,又或者说榜单是收钱了/假数据

像是terminalbench arcagi就一直在更新自己的测试题,一年都出了好几个版本,还有一些用户评价的elo榜单比如voxelbench(测试模型生成的mc建模能力)或者竞技场也都可以参考一下(但是竞技场也不是没有改对比权重从而提高胜率的先例 比如之前某些模型刚上线分数很高甚至第一过一段时间掉下去之类的)


编码能力测试的一些反例


视觉能力测试虽然比较少,但是可以看出来gemini和gpt的视觉推理甚至不推理的能力都超过目前很多跑分前沿的国模

比如之前有佬友发的


[6408032f98ebfaa0b3d3dcd709caa4b9]
答案是1996
目前看答对的国模有

Qwen3.8-Max
豆包 2.1turbo
GLM 5.3 Flash


Gemini和gpt甚至不开思考或者instant模式都能秒答对,但是这么多排行榜在顶前面的国模只有



能答对,都觉得智商低的豆包2.1turbo和pro也答对了,被认为“刷分”的qwen3.8max musespark1.3和Gemini3.8flash也都能答对 这是不是又和一些人的直觉感受不一样呢


小结


希望能看到这里的佬友讨论模型能力的时候都能实事求是,自己体验之后客观评价,不要迷信各种“榜单”,也不要跟着大部队跟风对模型情绪输出

至于模型降智/厂商封号那些是厂商运营或者态度问题,不能代表模型本身能力,可能对于订阅来说有参考性,但是对于希望真的在项目中运用模型的人是完全没有帮助的

最新回复 (10)
  • xiayi 09-11 00:32
    1

    所以我觉得,看自己使用感受,啥模型好用,就用啥模型就行了,天天为了这个模型去喷别的模型的,不知道有啥意义,到时候模型圈不会和机圈车圈一样了吧

  • 欣雨落 09-11 00:36
    2

    首先99%的人应该没有用过豆包2.1t

    要用你就用Pro,大部分人用的都是mini

    真正的办公任务是不让你用t的,直接用pro

    而免费用户不可能真的用豆包去办公。

    代码领域我觉得更不会有人去考虑它。


    豆包是文科生,历来如此。

    同时对于很多理科也有相当的统治力,在1.x系列就如此。

  • Linus Loi 09-11 00:36
    3

    佬友还挺费心的,我赞同,每个人使用情况不一样,有帮助就挺好。


    我说豆包这么强,为什么整天骂豆包。

  • SwiftUI 楼主 09-11 00:37
    4

    现在免费的话只能用到mini和turbo吧 默认快速模式用mini甚至应该都是几b的模型还不思考能不傻才奇怪了


    虽然turbo和pro编码也一般但是问答多模态应该都是国模第一梯队 包括那个asr模型

  • 欣雨落 09-11 00:40
    5

    mini实在是太差了

    现在连think都不给你了,思考都不思考,他已经彻底没有用了。


    当初专家模式刚上线 星缘就一顿夸。

    那是真的跨时代的变革


    现在的专家模式变成了2.1t已经跨越了多个版本,更加强大了


    没有人真的会去骂turbo,我是这样认为的。

    用豆包的人基本不会知道他到底在用什么模型。

  • rainyday 09-11 00:41
    6

    我们能做的只是用自己的体感去甄别这些主观评价,而且刻板影响是很正常的,起码在模型圈并没有出现大规模的饭圈现象,大家评价起来是没什么压力的

  • Linus Loi 09-11 00:42
    7

    赞同,豆包已经被骂成一种形容词了,gemini 不行的时候也能叫美国豆包~ ^-^

  • Guilliman 09-11 00:42
    8

    抖音上这种人很多,总是上来就带有立场没法友好讨论的,别人提出不同观点就好像冒犯他了,动不动让我去专升本,我都无语了,现在通通顺从不回复不讨论

  • linxiuuu 09-11 00:51
    9

    其实这是好事,两个月前只有吹cc和codex的。现在吹什么的都有,说明各家的能力都上来了,大家都有得选。

  • mi tu 09-11 01:28
    10

    我觉得最跟风的一次就是ds灰测那次了,铺天盖地的超越fable超越opus5。两个月过去了7月的灰测模型都没一点动静居然还有人说ds在藏就。。。

    Routing论还不能讨论,所有人都在用主观测评这个灰测模型,实际灰测有没有到这么多人我不好说,被灰测到的我的亲身测试不如社区流传一句话有效因为他支持我反对,集体狂热到头了。

    0813也是一次,上线后先是经历了用户流传该没全量上线,上错模型,需要某特定脚本解锁智商,用户使用某脚本跑分超越fable5。第一次见所有用户给一个模型找补的,过拟合问题我烧了80多跑了10多轮就算用到所谓的满血版也没社区流传的超越fable5的水平。

    感觉所有人都在咀嚼源头产的ai答辩和二手信息,模型好坏全看上游编的多离谱,不得不狠狠的吐槽了。

* 帖子来源Linux.do
返回