卡兹克榜单:大模型做今年高考题 mimo登顶竟然打过了gpt gemini 克劳德

Ningbainb 2026-06-09 11:26 1



来源卡兹克微信公众号

这个结果真是没想到

测试还是蛮严谨的 站内测的很多都是官网不是api会调用工具并不严谨

这是原文https://mp.weixin.qq.com/s/XxNGiUwXlYm1g9I-v9vaHg

补充一下

核对了一下,14 题确实是给错题干了[苦涩][苦涩][苦涩]对不起大家,因为我也是从网上搜罗的真题,也确实看不懂那道题,所以也没及时发现题干有问题[裂开][裂开][裂开]。下次一定会再细心一点,找外部专业人士确认。。。然后好消息是这样的话,其实很多模型在不借助任何外部工具的情况下,数学都能上 140 了。。。

最新回复 (19)
  • user2995 06-09 11:28
    1

    我只能说,我见过好几个版本的榜单了,看看就好

  • zpljd 06-09 11:29
    2

    充分体现了大模型的不确定性哈哈哈哈

  • wklwkl 06-09 11:29
    3

    腾讯的混元都比gpt5.5高?这模型真的有人在用吗?有点离谱了感觉

  • 咸鱼 06-09 11:29
    4

    不是说GPT,5分钟速通高考数学么?

  • user2995 06-09 11:30
    5

    文心数学都比chatgpt和Claude要强,我只能说有一些野榜

  • tydream 06-09 11:30
    6

    严谨在哪?可能不如站内测评。。。

  • gep 06-09 11:30
    7

    AI一次性跑新高考 I 卷数学究竟能拿多少分? 论坛测gpt三次都是满分

  • Ningbainb 楼主 06-09 11:31
    8

    我觉得这个是最客观的 统一调用的openr的api 不使用工具 纯考大模型原始做题能力

  • hhf166 06-09 11:31
    9

    哈哈,我在用。在微信里面有些话我不知道怎么回,我就转发给元宝然后给点小提示。

  • Ningbainb 楼主 06-09 11:31
    10

    他这个不是api测的 官网测可以调用各种工具还有联网搜索能力 并不客观啊

  • user2995 06-09 11:32
    11

    只是说起来严谨,不能说明做到了严谨,我怀疑这榜单有明显的倾向性

  • 奥托·阿波卡利斯 06-09 11:33
    12

    混元肘赢了gpt,老马怕不是笑死。然后大吹特吹。不过实际上并没有看到任何相关性的新闻。合理怀疑这个榜单是接了mino的商单。 ^-^

  • BOHE 06-09 11:33
    13

    只能说直接用模型的能力,大概分数区间就是这么个情况,有没有人到时候把理科全部卷子跑一遍,看看大概能上什么学校

  • Ningbainb 楼主 06-09 11:35
    14

    混元我是真没想到 太难绷了一点 这么小的模型还能在这么前面

  • 麋鹿叔叔 06-09 11:39
    15

    只能说直接用模型的能力,大概分数区间就是这么个情况,有没有人到时候把理科全部卷子跑一遍,看看大概能上什么学校



    一份试卷题目量太小,存在一定的偶然性 ^-^

  • 苦哈哈 06-09 11:42
    16

    gpt和claude哪个好用可能阶段性的有分歧,,,那gpt、claude和混元这种哪个好用,应该不会有分歧

  • CrazySword 06-09 11:44
    17

    这属于统计口径问题,各个榜单排名以及测评侧重,还有评分方法都是可以微调的 ^-^

  • blacksein 06-09 11:45
    18

    语文的话 opus4.8这种中文表达能力还能拿120分啊 ^-^

  • 番茄🍅 06-09 11:50
    20

    卡兹克曾经就因Manus被喷过,

* 帖子来源Linux.do
返回