中等难度版
测试题目和答案:
100题-中等版-题目和答案.zip (55.2 KB)
提示词:
请完成以下 100 道题。除题目明确要求外,不要联网,不要调用外部工具。选择题只输出题号和选项字母;代码题给出可执行实现。请按 1~100 顺序回答。
本测试集是一套用于评估大语言模型综合能力的中等难度测试题集,共包含 100 道题目。题目均选自公开的官方 Benchmark,不自行编写题目,尽可能保证测试内容具有可追溯性、客观性和不同模型之间的可比较性。
整套测试由四个部分组成:
测试集 |
题数 |
占比 |
主要测试能力 |
|---|
BigCodeBench |
40 |
40% |
代码生成、API/第三方库使用、数据处理、文件操作等综合编程能力 |
CRUXEval |
20 |
20% |
Python 代码理解、程序执行过程分析、精确输出预测 |
LiveBench Math |
20 |
20% |
数学推理、公式理解、证明过程分析与复杂数学上下文理解 |
LiveBench Reasoning |
20 |
20% |
逻辑推理、条件约束、关系推断和多步推理 |
合计 |
100 |
100% |
大模型综合能力 |
其中,BigCodeBench 是整套测试中占比最大的部分,共 40 题。题目并非简单的算法填空,而是更加接近实际 Python 编程任务,涉及 Pandas、NumPy、Matplotlib、Scikit-learn、文件读写、网络请求、数据处理、字符串处理以及加密等不同场景。例如部分题目要求模型根据函数说明直接编写可以运行的完整代码。
CRUXEval 共 20 题,主要测试模型“阅读代码并理解代码实际如何执行”的能力。题目通常提供一个 Python 函数和一组确定输入,要求模型给出程序的精确输出。这类题目能够有效考察循环、条件判断、列表修改、字符串操作以及 Python 语言细节等方面的代码推理能力。
LiveBench Math 共 20 题,主要考察复杂数学推理能力。测试中的题目包含 IMO、USAMO 等奥林匹克数学类型问题,并采用“完整解题过程 + 部分公式缺失 + 候选公式”的形式,要求模型结合上下文判断正确公式的位置,因此不仅要求数学计算正确,还要求模型理解较长的证明过程和公式之间的逻辑关系。
LiveBench Reasoning 共 20 题,主要测试纯逻辑推理和约束满足能力。其中包含典型的 Zebra Puzzle(斑马逻辑题):给出人物、位置、食物、职业、国籍、爱好等多个属性以及大量约束条件,模型需要通过多步推理确定各属性之间的对应关系,并回答最终问题。
为了使整套题目的难度集中在“中等”区间,题目按照各 Benchmark 自身提供的难度指标进行筛选。BigCodeBench 主要选择 instruct solve rate 在 35%~70% 范围内、并优先接近 52.5% 的题目;CRUXEval 因官方没有直接的难度字段,因此选择代码结构复杂度位于中间水平的题目;LiveBench Math 主要按照 hardness 指标筛选;LiveBench Reasoning 则主要选取 level 11~15、优先接近 level 13 的题目。
为了保证不同模型之间的测试结果具有可比性,测试时应保持统一环境:**禁止联网、搜索以及调用外部工具;所有模型使用相同的 System Prompt、Temperature 和最大输出长度。**不同测试集按照其官方答案或测试程序判分:BigCodeBench 使用官方 Test,CRUXEval 对照官方 Output,LiveBench 则对照官方 Ground Truth。
从能力构成来看,这 100 道题并不是单纯的“知识问答测试”。其中 60% 与编程直接相关(40 道代码生成 + 20 道代码理解),另外 40% 分别测试数学推理和逻辑推理。因此,这套测试更适合比较不同大模型在 编程能力、代码理解、数学推理、逻辑推理以及长上下文分析 等核心能力上的综合表现。
如果采用每题 1 分的简单计分方式,可以形成一个直观的 100 分制模型综合能力得分,同时保留四个分项成绩,从而避免单一总分掩盖模型在不同能力上的差异。例如可以同时报告:
综合得分:82/100
代码生成:34/40
代码理解:18/20
数学推理:14/20
逻辑推理:16/20
打分方法:由gpt-5.6-sol根据答案打分。每道题 1 分,答对得 1 分,答错或未作答得 0 分,总分为 100 分。
中等版排名:
- GPT-6 Astra:85
- GPT-5.6 Sol:78
- Qwen-3.8-Max:75
- DeepSeek-4.1-flash:67
- Gemini-3.8-flash:63
- Qwen-3.7-Plus:60
- Agnes-3.0-flash:52
- Qwen-3.6-Plus:50
(模型排行后续可能会继续补充)
排名 |
模型 |
BigCodeBench 40 |
CRUXEval 20 |
LiveBench Math 20 |
LiveBench Reasoning 20 |
总分 |
|---|
^-^ 1 |
GPT-6 Astra |
38 |
20 |
7 |
20 |
85 |
^-^ 2 |
GPT-5.6 Sol |
36 |
20 |
6 |
16 |
78 |
^-^ 3 |
Qwen-3.8-Max |
32 |
20 |
5 |
18 |
75 |
4 |
DeepSeek-4.1-flash |
34 |
20 |
3 |
10 |
67 |
5 |
Gemini-3.8-flash |
30 |
19 |
6 |
8 |
63 |
6 |
Qwen-3.7-Plus |
36 |
20 |
3 |
1 |
60 |
7 |
Agnes-3.0-flash |
22 |
17 |
4 |
9 |
52 |
8 |
Qwen-3.6-Plus |
28 |
20 |
0 |
2 |
50 |
Qwen-3.7-Plus 的代码其实很强,和 GPT-5.6 Sol 一样都是 36/40,但 Reasoning 只有 1/20,所以总分被严重拉低。Qwen-3.8-Max 则正好相反,代码只有 32/40,但 Reasoning 达到 18/20,因此总分冲到了第三。
以上只代表个人测试方法和测试结果,不一定准确,仅供参考。
高难度版
测试题目和答案:
100题-高难度版-题目和答案.zip (83.7 KB)
提示词:
请完成以下 100 道题。除题目明确要求外,不要联网,不要调用外部工具。选择题只输出题号和选项字母;代码题给出可执行实现。请按 1~100 顺序回答。
由于难度太大,参考意义不如中等版,因此没有详细测试,仅测试了几个模型。
本测试集是一套面向高性能大语言模型的 100 道综合能力高难度测试题。文档定位为“公开 Benchmark 极限版”,相比普通或中等难度测试,它更加侧重模型在复杂编程、精确代码推理、高阶数学、复杂约束推理以及数据分析等场景下的能力上限。
整套测试共分为 5 个部分:
测试部分 |
题数 |
占比 |
主要测试能力 |
|---|
BigCodeBench-Hard |
55 |
55% |
高难度代码生成、工程编程、第三方库与复杂任务实现 |
CRUXEval |
15 |
15% |
Python 代码理解、执行路径分析、精确输出预测 |
LiveBench Math |
12 |
12% |
高阶数学、竞赛数学、长链证明与公式推理 |
LiveBench Reasoning |
12 |
12% |
复杂逻辑约束、组合推理、多属性关系推断 |
LiveBench Data Analysis |
6 |
6% |
表格理解、字段识别、数据语义匹配与表连接 |
合计 |
100 |
100% |
大模型综合高难度能力 |
1. BigCodeBench-Hard:55题
BigCodeBench-Hard 是整套测试的核心,占全部题目的 55%。
这一部分要求模型根据自然语言任务说明直接完成可运行的 Python 函数,不仅考察基本编程能力,还覆盖 Pandas、NumPy、Scikit-learn、Matplotlib、OpenCV、NLP、机器学习、文件系统、网络通信、SSL/TLS、SMTP、进程管理、压缩文件、Web 抓取等大量真实工程场景。
例如题目中包含图像 K-Means 分割、NMF 主题提取、音频处理、PCA、ARIMA 时间序列预测、Word2Vec、RSA/AES 加密、Flask 身份验证、Socket/SSL、子进程并发执行等任务,因此对模型的要求已经明显超出普通算法题,更接近复杂的软件工程任务。
这部分的难度非常突出。题集开头大量题目的公开 instruct solve rate 为 0.0%,而靠后的部分也仅出现约 0.6%~1.2% 的公开解决率。例如第 55 题的公开 instruct solve rate 也只有 1.2%。
因此,这 55 道题非常适合作为区分顶级模型编程能力上限的主要测试部分。
2. CRUXEval:15题
CRUXEval 共 15 题,编号 56~70,主要测试模型的 代码理解与程序执行推理能力。
题目通常给出一段 Python 函数以及确定输入,要求模型在不真正执行代码的情况下准确推导程序最终输出。
高难度版本中的代码会更加容易出现反直觉行为,例如字符串切片、列表原地修改、嵌套循环、格式化字符串、特殊边界值、条件分支和 Python 内置函数之间的组合,因此它测试的不只是“会不会 Python”,而是模型是否真正理解 Python 的运行语义。
这一部分尤其容易暴露模型的“看起来理解代码,但实际执行推演错误”的问题。
3. LiveBench Math:12题
LiveBench Math 共 12 题,编号 71~82。
这一部分主要来自 IMO、USAMO 等竞赛数学类型问题,涉及数论、组合数学、代数、几何、序列以及证明题等。
它并非只要求模型算出一个数值答案,而是给出较长的数学证明过程,其中部分公式被替换为 <missing X>,模型需要从候选公式中判断每一个缺失位置应该填入什么内容。
因此实际测试的是:
数学知识 + 长上下文理解 + 证明结构分析 + 公式匹配 + 多步逻辑推理。
例如部分题目的证明过程包含几十个缺失公式,需要模型在一个很长的数学推导链中持续保持前后一致性,对推理稳定性要求很高。
4. LiveBench Reasoning:12题
LiveBench Reasoning 共 12 题,编号 83~94。测试内容主要是高复杂度 Zebra Puzzle(斑马逻辑题)等约束推理任务。
例如一道题可能同时给出 5 个人以及饮料、食物、国籍、宠物、运动等多个属性,再提供大量诸如:
“位于左侧”“具有相同奇偶位置”“A 与 B 不能相同”“A 或 B 成立但不能同时成立”等约束。
模型必须同时维护大量条件,并通过多步排除和组合推理得到唯一解。
这一版本的推理题已经出现 level=20 的题目,而第 94 题仍达到 level=18,明显属于较复杂的约束满足问题。
因此,这部分主要用于测试模型在长推理链、多变量约束以及逻辑一致性方面的能力。
5. LiveBench Data Analysis:6题
高难度版相比前面的中等版还额外加入了 LiveBench Data Analysis,共 6 题,编号 95~100。
其中第 95~96 题属于 CTA(Column Type Annotation / 列类型识别) 类型:模型只能根据一组数据样本以及大量候选字段名称,判断这组数据真正对应哪个字段。
第 97~100 题则属于 Table Join 类型。模型会看到两个列名完全不同、甚至经过混淆处理的 CSV 表,需要通过数据内容、取值规律和语义关系判断两个表中哪些字段实际上相互对应,并输出正确的列映射。
这类题和传统数学或编程题不同,它更接近真实的数据分析工作,主要测试:
数据理解、模式识别、字段语义推断、跨表匹配以及抗噪声能力。
打分方法:由gpt-5.6-sol根据答案打分。每道题 1 分,答对得 1 分,答错或未作答得 0 分,总分为 100 分。
高难度版排名:
GPT-6 Astra:44
GPT-5.6 Sol:35
DeepSeek-4.1-flash:23(超快)
Agnes-3.0-flash:18