有没有人从“完成任务”的角度来评测过 A\ 和 OAI 的套餐额度消耗?

LLMeme 2026-08-09 12:21 1

最近关于 CodeX 的额度重置有很多争议,让我想起一个大家应该都学过的典故:



宋国有个养猴子的老人,喜爱猴子,养了一大群。他能理解猴子的心思,猴子们也懂得他的心意。他宁可减少自己家中的口粮,也要满足猴子们的欲望。不久,家里的粮食就匮乏了,他打算限制猴子们的食物,又担心猴子们不听从自己的管束。于是先欺骗它们说:“给你们橡树果实,早上三颗,晚上四颗,够吗?” 所有的猴子听了都跳起来发怒。过了一会儿,他又说:“给你们橡树果实,早上四颗,晚上三颗,够吗?” 所有的猴子听了都高兴地趴在地上。



这不禁使我产生一个无端的揣测:如果地主家也没有余粮了,可能会趁模型版本更新暗改额度,被发现还是会招致批评。但如果在暗改额度的同时还不断发重置,使其内部平均消耗和之前都差不多,是不是用户反而还要感谢呢?


这里的关键在于“暗改额度”是否可以证明。之前论坛里也有相关讨论,但很多都是主观感受。而且 A\ 的消耗也不一定低,毕竟有基于 DS V4 Flash 0731 的 harness 评测发现 CC 的消耗明显要更高。


现在模型的评测很多时候已经有 per task 的消耗金额数据了。所以比较好奇,有没有人从完成任务的角度来评测过 A\ 和 OAI 套餐的额度消耗?或许可以像手机的续航测试一样,设置一揽子任务来更贴近实际应用场景。


而且这可能需要持续监测,不是多个版本前测过一次就能定论的。

最新回复 (8)
  • 慢半拍的光 08-09 12:23
    1

    现在没有统一的标准,harness都不一样。

  • sse 08-09 12:25
    2

    artificialanalysis有个Cost per Task的榜

  • LLMeme 楼主 08-09 12:26
    3

    harness 反倒不是问题,毕竟现在主流的几家都在自己搞 harness ,如果有的都用自家评测也是一种公平

  • LLMeme 楼主 08-09 12:27
    4

    这就是我说的,模型已经有了 per task 的评测,但基于 per task 评测套餐用量的好像还比较缺乏

  • bluetyty 08-09 12:28
    5

    终极完成度来说,是走向自我部署 ^-^ ^-^

  • sse 08-09 12:29
    6

    一般评估套餐用量是换算为对应的api额度,所以需要再换算一次

  • neteroster 08-09 12:32
    7

    不是,暗改额度不是早就能证明的事情了吗,不用什么 per-task,按API刊例价格计量套餐美元额度就行了


    实际上这事情非常动态,plus50-200周限都见过,pro1500-3000都见过

  • LLMeme 楼主 08-09 12:56
    8

    关键是美元额度还是难以直接换算为实际完成工作的能力


    API 刊例本身有巨大水分,不然 luna 也不会降了 80%。也不能简单应用 Artificial Analysis 等评测机构的 per task 数据换算,因为评测用的 harness 很多是自研的,和实际使用不一定等价。


    更何况 A\ 和 OAI 自己的 harness 也是在不断调整中。比如之前 CodeX 出事了就加了一条“禁止 rm -rf $HOME”。CodeX 至今的上下文长度还是比 CC 少,这可能也潜在地帮 OAI 省了不少钱,如果用 API 测也是测不出来的。

* 帖子来源Linux.do
返回