大模型能力到底怎么样?自己测(Qwen-3.8-Max超预期)

wilsons 2026-09-13 11:51 1

中等难度版


测试题目和答案:


100题-中等版-题目和答案.zip (55.2 KB)


提示词:


请完成以下 100 道题。除题目明确要求外,不要联网,不要调用外部工具。选择题只输出题号和选项字母;代码题给出可执行实现。请按 1~100 顺序回答。

本测试集是一套用于评估大语言模型综合能力的中等难度测试题集,共包含 100 道题目。题目均选自公开的官方 Benchmark,不自行编写题目,尽可能保证测试内容具有可追溯性、客观性和不同模型之间的可比较性。


整套测试由四个部分组成:












































测试集 题数 占比 主要测试能力
BigCodeBench 40 40% 代码生成、API/第三方库使用、数据处理、文件操作等综合编程能力
CRUXEval 20 20% Python 代码理解、程序执行过程分析、精确输出预测
LiveBench Math 20 20% 数学推理、公式理解、证明过程分析与复杂数学上下文理解
LiveBench Reasoning 20 20% 逻辑推理、条件约束、关系推断和多步推理
合计 100 100% 大模型综合能力


其中,BigCodeBench 是整套测试中占比最大的部分,共 40 题。题目并非简单的算法填空,而是更加接近实际 Python 编程任务,涉及 Pandas、NumPy、Matplotlib、Scikit-learn、文件读写、网络请求、数据处理、字符串处理以及加密等不同场景。例如部分题目要求模型根据函数说明直接编写可以运行的完整代码。


CRUXEval 共 20 题,主要测试模型“阅读代码并理解代码实际如何执行”的能力。题目通常提供一个 Python 函数和一组确定输入,要求模型给出程序的精确输出。这类题目能够有效考察循环、条件判断、列表修改、字符串操作以及 Python 语言细节等方面的代码推理能力。


LiveBench Math 共 20 题,主要考察复杂数学推理能力。测试中的题目包含 IMO、USAMO 等奥林匹克数学类型问题,并采用“完整解题过程 + 部分公式缺失 + 候选公式”的形式,要求模型结合上下文判断正确公式的位置,因此不仅要求数学计算正确,还要求模型理解较长的证明过程和公式之间的逻辑关系。


LiveBench Reasoning 共 20 题,主要测试纯逻辑推理和约束满足能力。其中包含典型的 Zebra Puzzle(斑马逻辑题):给出人物、位置、食物、职业、国籍、爱好等多个属性以及大量约束条件,模型需要通过多步推理确定各属性之间的对应关系,并回答最终问题。


为了使整套题目的难度集中在“中等”区间,题目按照各 Benchmark 自身提供的难度指标进行筛选。BigCodeBench 主要选择 instruct solve rate 在 35%~70% 范围内、并优先接近 52.5% 的题目;CRUXEval 因官方没有直接的难度字段,因此选择代码结构复杂度位于中间水平的题目;LiveBench Math 主要按照 hardness 指标筛选;LiveBench Reasoning 则主要选取 level 11~15、优先接近 level 13 的题目。


为了保证不同模型之间的测试结果具有可比性,测试时应保持统一环境:**禁止联网、搜索以及调用外部工具;所有模型使用相同的 System Prompt、Temperature 和最大输出长度。**不同测试集按照其官方答案或测试程序判分:BigCodeBench 使用官方 Test,CRUXEval 对照官方 Output,LiveBench 则对照官方 Ground Truth。


从能力构成来看,这 100 道题并不是单纯的“知识问答测试”。其中 60% 与编程直接相关(40 道代码生成 + 20 道代码理解),另外 40% 分别测试数学推理和逻辑推理。因此,这套测试更适合比较不同大模型在 编程能力、代码理解、数学推理、逻辑推理以及长上下文分析 等核心能力上的综合表现。


如果采用每题 1 分的简单计分方式,可以形成一个直观的 100 分制模型综合能力得分,同时保留四个分项成绩,从而避免单一总分掩盖模型在不同能力上的差异。例如可以同时报告:


综合得分:82/100

代码生成:34/40

代码理解:18/20

数学推理:14/20

逻辑推理:16/20



打分方法:由gpt-5.6-sol根据答案打分。每道题 1 分,答对得 1 分,答错或未作答得 0 分,总分为 100 分。


中等版排名:



  1. GPT-6 Astra:85

  2. GPT-5.6 Sol:78

  3. Qwen-3.8-Max:75

  4. DeepSeek-4.1-flash:67

  5. Gemini-3.8-flash:63

  6. Qwen-3.7-Plus:60

  7. Agnes-3.0-flash:52

  8. Qwen-3.6-Plus:50


(模型排行后续可能会继续补充)


























































































排名 模型 BigCodeBench 40 CRUXEval 20 LiveBench Math 20 LiveBench Reasoning 20 总分
^-^ 1 GPT-6 Astra 38 20 7 20 85
^-^ 2 GPT-5.6 Sol 36 20 6 16 78
^-^ 3 Qwen-3.8-Max 32 20 5 18 75
4 DeepSeek-4.1-flash 34 20 3 10 67
5 Gemini-3.8-flash 30 19 6 8 63
6 Qwen-3.7-Plus 36 20 3 1 60
7 Agnes-3.0-flash 22 17 4 9 52
8 Qwen-3.6-Plus 28 20 0 2 50

Qwen-3.7-Plus 的代码其实很强,和 GPT-5.6 Sol 一样都是 36/40,但 Reasoning 只有 1/20,所以总分被严重拉低。Qwen-3.8-Max 则正好相反,代码只有 32/40,但 Reasoning 达到 18/20,因此总分冲到了第三。



以上只代表个人测试方法和测试结果,不一定准确,仅供参考。




高难度版


测试题目和答案:


100题-高难度版-题目和答案.zip (83.7 KB)


提示词:


请完成以下 100 道题。除题目明确要求外,不要联网,不要调用外部工具。选择题只输出题号和选项字母;代码题给出可执行实现。请按 1~100 顺序回答。

由于难度太大,参考意义不如中等版,因此没有详细测试,仅测试了几个模型。


本测试集是一套面向高性能大语言模型的 100 道综合能力高难度测试题。文档定位为“公开 Benchmark 极限版”,相比普通或中等难度测试,它更加侧重模型在复杂编程、精确代码推理、高阶数学、复杂约束推理以及数据分析等场景下的能力上限。


整套测试共分为 5 个部分


















































测试部分 题数 占比 主要测试能力
BigCodeBench-Hard 55 55% 高难度代码生成、工程编程、第三方库与复杂任务实现
CRUXEval 15 15% Python 代码理解、执行路径分析、精确输出预测
LiveBench Math 12 12% 高阶数学、竞赛数学、长链证明与公式推理
LiveBench Reasoning 12 12% 复杂逻辑约束、组合推理、多属性关系推断
LiveBench Data Analysis 6 6% 表格理解、字段识别、数据语义匹配与表连接
合计 100 100% 大模型综合高难度能力


1. BigCodeBench-Hard:55题


BigCodeBench-Hard 是整套测试的核心,占全部题目的 55%


这一部分要求模型根据自然语言任务说明直接完成可运行的 Python 函数,不仅考察基本编程能力,还覆盖 Pandas、NumPy、Scikit-learn、Matplotlib、OpenCV、NLP、机器学习、文件系统、网络通信、SSL/TLS、SMTP、进程管理、压缩文件、Web 抓取等大量真实工程场景。


例如题目中包含图像 K-Means 分割、NMF 主题提取、音频处理、PCA、ARIMA 时间序列预测、Word2Vec、RSA/AES 加密、Flask 身份验证、Socket/SSL、子进程并发执行等任务,因此对模型的要求已经明显超出普通算法题,更接近复杂的软件工程任务。


这部分的难度非常突出。题集开头大量题目的公开 instruct solve rate 为 0.0%,而靠后的部分也仅出现约 0.6%~1.2% 的公开解决率。例如第 55 题的公开 instruct solve rate 也只有 1.2%。


因此,这 55 道题非常适合作为区分顶级模型编程能力上限的主要测试部分。


2. CRUXEval:15题


CRUXEval 共 15 题,编号 56~70,主要测试模型的 代码理解与程序执行推理能力


题目通常给出一段 Python 函数以及确定输入,要求模型在不真正执行代码的情况下准确推导程序最终输出。


高难度版本中的代码会更加容易出现反直觉行为,例如字符串切片、列表原地修改、嵌套循环、格式化字符串、特殊边界值、条件分支和 Python 内置函数之间的组合,因此它测试的不只是“会不会 Python”,而是模型是否真正理解 Python 的运行语义。


这一部分尤其容易暴露模型的“看起来理解代码,但实际执行推演错误”的问题。


3. LiveBench Math:12题


LiveBench Math 共 12 题,编号 71~82。


这一部分主要来自 IMO、USAMO 等竞赛数学类型问题,涉及数论、组合数学、代数、几何、序列以及证明题等。


它并非只要求模型算出一个数值答案,而是给出较长的数学证明过程,其中部分公式被替换为 <missing X>,模型需要从候选公式中判断每一个缺失位置应该填入什么内容。


因此实际测试的是:


数学知识 + 长上下文理解 + 证明结构分析 + 公式匹配 + 多步逻辑推理。


例如部分题目的证明过程包含几十个缺失公式,需要模型在一个很长的数学推导链中持续保持前后一致性,对推理稳定性要求很高。


4. LiveBench Reasoning:12题


LiveBench Reasoning 共 12 题,编号 83~94。测试内容主要是高复杂度 Zebra Puzzle(斑马逻辑题)等约束推理任务。


例如一道题可能同时给出 5 个人以及饮料、食物、国籍、宠物、运动等多个属性,再提供大量诸如:


“位于左侧”“具有相同奇偶位置”“A 与 B 不能相同”“A 或 B 成立但不能同时成立”等约束。


模型必须同时维护大量条件,并通过多步排除和组合推理得到唯一解。


这一版本的推理题已经出现 level=20 的题目,而第 94 题仍达到 level=18,明显属于较复杂的约束满足问题。


因此,这部分主要用于测试模型在长推理链、多变量约束以及逻辑一致性方面的能力。


5. LiveBench Data Analysis:6题


高难度版相比前面的中等版还额外加入了 LiveBench Data Analysis,共 6 题,编号 95~100


其中第 95~96 题属于 CTA(Column Type Annotation / 列类型识别) 类型:模型只能根据一组数据样本以及大量候选字段名称,判断这组数据真正对应哪个字段。


第 97~100 题则属于 Table Join 类型。模型会看到两个列名完全不同、甚至经过混淆处理的 CSV 表,需要通过数据内容、取值规律和语义关系判断两个表中哪些字段实际上相互对应,并输出正确的列映射。


这类题和传统数学或编程题不同,它更接近真实的数据分析工作,主要测试:


数据理解、模式识别、字段语义推断、跨表匹配以及抗噪声能力。



打分方法:由gpt-5.6-sol根据答案打分。每道题 1 分,答对得 1 分,答错或未作答得 0 分,总分为 100 分。


高难度版排名:


GPT-6 Astra:44

GPT-5.6 Sol:35

DeepSeek-4.1-flash:23(超快)

Agnes-3.0-flash:18

最新回复 (1)
  • wilsons 楼主 09-13 15:45
    1

    Qwen-3.7-Plus 的代码其实很强,和 GPT-5.6 Sol 一样。

























































































    排名 模型 BigCodeBench 40 CRUXEval 20 LiveBench Math 20 LiveBench Reasoning 20 总分
    ^-^ 1 GPT-6 Astra 38 20 7 20 85
    ^-^ 2 GPT-5.6 Sol 36 20 6 16 78
    ^-^ 3 Qwen-3.8-Max 32 20 5 18 75
    4 DeepSeek-4.1-flash 34 20 3 10 67
    5 Gemini-3.8-flash 30 19 6 8 63
    6 Qwen-3.7-Plus 36 20 3 1 60
    7 Agnes-3.0-flash 22 17 4 9 52
    8 Qwen-3.6-Plus 28 20 0 2 50

    Qwen-3.7-Plus 的代码其实很强,和 GPT-5.6 Sol 一样都是 36/40,但 Reasoning 只有 1/20,所以总分被严重拉低。Qwen-3.8-Max 则正好相反,代码只有 32/40,但 Reasoning 达到 18/20,因此总分冲到了第三。

* 帖子来源Linux.do
返回