1. 测试方法
各取科目一和科目四题目一百道纯文本题目,请求 /v1/systemone
请求
{
"state": { "question": "……", "options": ["A. 正确", "B. 错误"] },
"model": "jev-latest",
"questions": {
"decision": {
"type": "choice",
"instructions": "……从给定标签中选出唯一正确项",
"criteria": { "A": "……", "B": "……" }
}
}
}
响应
{
"model": "jev-1.13.0",
"answers": { "decision": { "choice": "A", "confidence": 0.98,
"probabilities": { "A": 0.99, "B": 0.01 } } },
"usage": { "input_tokens": 403, "output_tokens": 31 }
}
2. 数据
- 总体:93.25%(373/400)
- 科目一:91.50%(183/200)
- 科目四:95.00%(190/200)
- 问两遍:93.0% / 93.5%,200 组里有 199 组两次答的一模一样(99.5%)
- 单题耗时:中位 758 ms,均值 767 ms,P90 814 ms
- 每题消耗:约 520 输入 token / 31 输出 token
3. 置信度分析
- 置信度 < 0.5 → 正确率 62.8%(43 次)
- 0.5 – 0.79 → 正确率 80.5%(41 次)
- 0.80 – 0.94 → 正确率 98.6%(71 次)
- ≥ 0.95 → 正确率 99.2%(245 次)
答对的平均置信度 0.889,答错的平均置信度 0.392
4. 错题分析
一、跟数字有关的条规
“超速 40% 记 6 分”、“逃逸尚不构成犯罪罚一千”、“拼装车上路罚一千”、“不系安全带警告或 50 元”…… 这类题它经常把"正确"判成"错误"。而且这里面有一条是唯一一个信心满满答错的——“造成交通事故后逃逸,尚不构成犯罪的,处一千元罚款”,它给了 0.96 的置信度说这是错的。
二、地方性规定和程序细节
比如"浙江省注册登记的载货汽车车门要喷涂单位名称"这种省级规定,它没这个知识。还有"科目二科目三可以同时预约、连续考试"、“违反道交法发生事故算不算交通违章行为”(考点其实是"违章"这个词已经改成"违法"了)这类。
三、科目四的实操常识被反向理解
这类特别典型,它倾向于接受那些"听起来有道理但其实很危险"的表述:
- “夜间全车灯光突然熄灭,应当立即迅速制动靠边停车” → 实际是错的(不能迅速制动)
- “高速上着火要开进服务区灭火” → 错的
- “长下坡可以间歇性用驻车制动辅助制动” → 错的
- “转向助力失效就紧握方向盘保持低速” → 错的
不过好消息是这一类它的置信度普遍很低(0.00 – 0.71),用阈值就能拦住
四、唯一一个两次回答一对一错的题
- “机动车在道路上临时停车应当按顺行方向停车,车身距道路边缘不超过50厘米”
A. 正确 B. 错误 (答案键:B)
第 1 次 • 判定: A • 置信度: 0.11 • 概率分布: B 0.45 / A 0.55
第 2 次 • 判定: B • 置信度: 0.07 • 概率分布: B 0.53 / A 0.47
Jev 两次的概率都压在 0.45/0.55 和 0.53/0.47,基本就是抛硬币 —— 也就是说,唯一的"不稳定"这一条,恰好也是它自己明确标注不确定的一条
4. 结论
- 可用性:在无图判断题上,Jev 单次调用即可达到 93% 级别,延迟 ~0.76 s、单价极低(每题输入约 520 token),适合作为"低成本批量预筛".
- 不要盲信单次输出:14 个错题题干的重复表现稳定(13 题两次都错),说明错就是稳定的知识盲区。
- 用置信度做门控:
confidence ≥ 0.80 的 79% 判定正确率 99.05%,可以放心自动采纳;<0.80 的 21% 建议人工或规则兜底
- 本次评测的边界:只覆盖判断题(2 选项)。四选一单选题、多选题、含图片题未纳入