真的受不了现在的榜单风气了,有共鸣的佬嘛

stone91 2026-08-27 11:28 1

自从25年Agentic coding开始推行,模型在后训练的路上越走越远了,开始逐渐变得不说人话。

大概在26年初,opus 4.7之后,这件事情开始变得无法忍受了。

现在榜单,统一都是Agentic能力,Knowledge能力,拿最近经常参考的artificial analysis网站的intelligence index来举例子:


GDPval-AA v2(智能体, 真实业务与网页实操), 𝜏³-Banking(智能体, 银行交互与工具调用), Terminal-Bench v2.1(编程, 终端实操与系统运维),
SciCode(编程, 理科科学计算), Humanity's Last Exam(科学推理, 跨学科专家级学术), GPQA Diamond(科学推理, 博士级科学问答),
CritPt(科学推理, 前沿物理研究推导), AA-Omniscience(通用, 事实知识与抗幻觉), AA-LCR(通用, 长文本推理与信息整合)

里面完全没有涉及到可读性。


这是很不好的一件事,其实我觉得一个AI好用与否,除了解决问题的能力之外,还有两个地方很重要!


第一个,就是TPS(token per sec),这关乎Agent能够多快跟世界交互。

第二个,就是可读性(reading available),这关乎Agent输出的内容,人类能够多块的理解和消化,可读性越好,人类越能给出更准确的指令,做出正确决策,进行高质量的review而不是一路yes yes。比如,gemini-3.7-flash虽然不顶级,但是因为可读好,tps高,不失为一把好武器。


现在,似乎没有可以参考的可读性榜单=。=, 有佬可以给一些参考性的榜么。

最新回复 (19)
  • Sokeu 08-27 11:35
    1


    你是不是再找

  • 战斗下去 08-27 11:38
    2

    这点真的非常感同身受了,ds,gpt,还有grok,问点408的计组和操作系统;搞点线性代数,我的天,解题是很强,但是思路有点非人,算个极限做高数动不动就上中值定理

  • 战斗下去 08-27 11:39
    3

    gemini用了一年了,3.1pro回复有点慢,但是从没让我失望过,3.7flash又快又好,讲解计组的硬件图,数据通路那块,给我搞的明明白白的,因为他的过程就像一个标准的解题思路而不是像书本一样的防自学推导;什么时候注意什么条件,推出什么结果,然后上一步的结果是怎么接续到下一步的,非常清楚

  • XZiar 08-27 11:41
    4

    tps跟用的硬件、推理服务infra关系很大,就算人家测出一个值也不代表你能用到那个级别的速度,所以没意义。

    至于可读性……走在时代前沿的用户已经放弃模型回复的可读性只看“模型作出的成果”了吧……

    说白了还是看中agentic,尤其是无人工介入的agentic……

  • 时牧 08-27 11:41
    5

    可读性这一块是越来越差了…

    grok4.6 opus5 gpt5.6 都越来越走偏了

  • iMoTong 08-27 11:43
    6

    GPT老是说一些黑话,很难理解的

  • stone91 楼主 08-27 11:43
    7

    无人工介入的agentic恐怕不是一个正确的方向,因为总归是要跟人类交互的,或者说结果人类至少得看。

    opus吐出的某些东西,就像毒药一样,看到了眼睛会枯萎。。

  • impouo 08-27 11:43
    8

    tps其实没啥意义,这个主要取决于推理方的预算,和你能用到的是两码事。


    可读性其实挺重要的,可惜现在大势所趋是卷agentic和coding,无人在意可读性,也并没有合适的评价。

  • Y 08-27 11:44
    9

    可读性好像很难有客观评价标准^-^^-^

  • Eric Cartman 08-27 11:46
    10

    你说现在的模型不说人话,倒是给出一些不说人话的例子啊

  • jantrid 08-27 11:47
    11

    能力还是大于可读性吧,毕竟一个光会说话但不干活的模型也没人用,可读性也这个不好量化评价。

    而且还有一个问题是,可能原本算会说话的,但你看多了熟悉了那个味儿,就又会审美疲劳觉得难受了,感觉LLM还是很难摆脱某种固定套路。

  • stone91 楼主 08-27 11:50
    12

    tps意义很大,举一个例子,grok4.6 fast就可以一下午干很多事情,但是如果用普通的,就干不了啥事情,基本上只能玩手机等了,某些情况下不如古法编程。

  • hoston 08-27 11:51
    13

    可读性



    可读性好主观啊,有什么指标吗?我看codex也可以通过设置提示词让它说人话,这应该不算做模型能力,只是偏好?

  • 张全蛋 08-27 11:52
    14

    ai返回的内容,不同知识储备的人,看到的感受完全不一样。

    如果是菜鸟,其实ai已经给了足够的内容了,奈何就是看不懂。而往往会把看不懂的内容叫做可读性差

    但是对于老手来说,太详细的解释又过于啰嗦

  • Kassdin 08-27 11:52
    15

    像 Agent 能力只要看通过率就行了,你这个怎么评估呢 ?人本身自己就有偏见,让专家来评估,评估成本又远大于跑一遍 agent benchmark 。

    TPS也就那样吧,你以为 TPS 高几倍,执行速度就能够高相同的倍数,实际上 API 时间大概只占 Agent 运行的一半,像编译 跑测试 包括各种命令的运行的时间缩短不了呀。所以加速也是在那一半里面加速。

  • jcc 08-27 11:53
    16

    靠人类盲测打分的那些前端榜,ui交互榜


    这是关于人类可读性和人类阅读体验的


    你能看到这类榜单上,gpt的模型排名很靠后,说明还是很权威的

  • rainoffallingstar 08-27 11:53
    17

    也就那样吧

    出来一个模型大家都在抽卡画svg

    翻车的也很多

  • Carlos 08-27 11:58
    18

    TPS 跟模型没关系,跟模型api的提供方有关

    可读性, 无法量化,纯体感


    佬是不是不用模型编程,一般用来写文? 这不是当前模型(厂商)的方向

  • 小猫曦月 08-27 12:00
    19



    请问这个算是不说人话吗?我做的都要崩溃了,模型是opus5 ^-^

* 帖子来源Linux.do
返回