Qwen3.8-Max 评测指标直逼Fable5 Max和Qwen3.8-27B模型权重预计下周开源

fengchris 2026-08-03 10:10 1

官方博客:https://qwen.ai/blog?id=qwen3.8







完整性能结果
































































































































































































































































































Opus4.8 Fable5 GPT5.6 Sol (max) Qwen3.7-Max Qwen3.8-Max
Coding Agent
Terminal Bench 2.1 84.6 84.6 88.8 74.5 86.6
SWE-bench Pro 69.2 80.0 64.6 60.6 67.7
DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6
NL2Repo-Bench 69.4 -- -- 47.2 55.9
FrontierSWE 70.0 88.8 -- 40.7 73.5
MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0
PaperBench 80.3 88.8 90.5 64.8 93.0
AndroidBench 69.8 84.5 74.0 56.5 70.2
QwenSWEBench 84.0 86.3 73.5 63.4 80.7
QwenQoderBench 62.7 63.1 53.8 36.8 58.4
QwenReactBench 1694 1770 1564 1538 1724
QwenSVGBench 1648 1690 1758 1499 1713
General Agent
CoWorkBench 72.3 75.9 71.5 64.6 74.8
WorkSpaceBench 66.8 68.7 65.6 61.4 67.7
JobBench 48.4 57.4 45.4 31.3 53.4
SkillsBench 65.1 70.9 73.5 61.2 70.2
Agents’ Last Exam (Pass / Score) 27.0 / 45.1 -- / – 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4
Automation-Bench (Pass@1) 27.2 29.1 29.7 14.2 27.3
Toolathlon Verified (Pass@1) 76.2 77.9 74.9 49.7 72.5
WideSearch 72.9 81.2 -- 75.2 81.9
HLE w/ tools 57.9 64.5 58.0 53.5 56.2
General Capabilities
GPQA Diamond 92.0 92.6 94.1 92.4 92.6
HLE 45.7 53.3 47.2 41.4 43.6
IFBench 62.2 63.5 72.7 79.1 82.8
$OneMillion-Bench (expert score) 41.8 55.9 53.8 44.4 52.5
HealthBench 52.4 -- 55.3 54.5 60.2
PLawBench 69.6 70.2 72.3 58.9 73.2
PRBench-Legal 52.7 57.6 57.6 48.5 57.6
PRBench-Finance 51.9 55.8 55.5 46.8 58.3
MRCR v2 256K (8-needle) 83.2 -- 93.8 86.7 92.9
LongBench v2 69.1 -- 67.1 65.3 66.3
























































































































































































































































































































































































































































































































Opus4.8
Fable5 Gemini3.1-Pro GPT5.6-Sol Qwen3.7-Plus Qwen3.8-Max
Multimodal Reasoning
MMMU-Pro 75.6 81.2 80.5 83.0 79.0
MathVision 87.1 / 97.1 92.7 / 98.6 87.4 / 95.7 90.8 / 97.8 90.3 / –
BabyVision 28.4 / 81.2 42.5 / 90.5 55.9 / 68.3 65.5 / 88.9 64.7 / 70.4
HLE-VL (w/ Tools) -- -- 43.9 51.2 25.6
ZeroBench (Pass@5) 17.0 / 34.0 20.0 / 46.0 17.0 / 23.0 22.0 / 35.0 19.0 / 19.0
ZeroBench-Sub 31.1 37.1 36.5 46.7 41.0
LogicVista 76.7 85.7 82.6 89.7 84.3
HiPhO 69.3 78.6 85.4 86.8 84.1
PhyX 54.2 71.7 79.4 79.1 80.0
SLAKE 75.9 86.6 82.9 85.1 83.2
MedXpertQA-MM 71.7 80.0 80.7 81.5 71.0
PMC-VQA 59.2 63.2 62.5 62.3 63.4
Visual Agent & Coding
OSWorld-Verified 83.4 85.0 76.2 83.2 73.3
OSWorld 2.0 20.6 / 54.8 -- / 66.1 7.8 / 30.6 -- / 62.6 2.8 / 21.5
ScreenSpot Pro 82.3 87.3 68.1 81.3 79.0
WebArena-Verified 67.9 71.3 64.3 69.7 55.3
AndroidWorld 75.0 88.8 70.7 77.6 81.0
MobileWorld 67.5 85.5 58.1 76.9 51.2
ClawEval-MM 73.3 / 73.8 81.2 / 77.5 50.5 / 55.2 81.2 / 78.9 57.4 / 60.1
Vision2Web 62.4 70.5 -- 62.1 42.1
QwenBlenderBench 62.4 69.5 23.0 68.6 41.5
Parametric CAD Bench 85.1 87.5 73.5 86.2 73.8
RecreationBench 48.0 56.1 16.2 47.6 30.2
PresentBench 80.9 79.8 55.4 82.9 65.7
Document & Office Intelligence
CharXiv (RQ) 78.5 / 89.9 87.9 / 93.5 84.4 / 89.9 85.1 / 89.1 85.8 / 85.9
OmniDocBench 1.5 86.5 89.5 90.0 86.7 91.4
OCR-Bench-V2 (EN/ZH) 53.9 / 55.3 65.3 / 58.1 64.6 / 58.2 69.0 / 57.3 70.7 / 67.1
CC-OCR-Bench-V2 60.3 72.4 68.9 68.0 72.7
MTVQA-Test 48.1 41.6 54.3 52.7 51.2
MADQA 86.8 86.0 81.1 87.8 87.1
QwenVisualOffice 34.5 32.4 39.6 29.5 32.4
Real-World & Spatial Understanding
RealWorldQA 76.6 85.9 83.5 83.7 86.9
ERQA 57.2 70.0 68.0 70.0 69.8
LingoQA 73.8 77.4 66.8 72.6 83.4
SURDS 62.2 79.4 64.0 63.0 77.2
Visual Perception & Grounding
SimpleVQA 67.3 73.4 73.1 66.6 70.3
WorldVQA 33.9 53.5 54.0 45.1 43.9
MMStar 76.7 80.5 84.0 82.5 83.2
PerceptionBench 47.2 57.2 56.2 59.7 51.1
CountQA 41.3 63.1 72.8 68.6 77.0
RefAdv-S 61.7 68.6 71.9 69.2 73.0
Dense200 20.8 31.1 69.7 55.3 60.7
COCO 50.7 56.4 72.4 61.2 74.2
VisFactor 30.1 54.5 39.8 62.8 42.8
VLMsAreBiased 43.8 61.2 74.1 59.8 36.6
Video Intelligence & Agents
VideoMME (w/ Sub.) 85.4 -- 86.7 89.5 88.0
VideoMME v2 (w/ Sub.) 49.0 52.2 66.9 71.1 59.7
VideoMMMU 75.3 81.2 85.3 85.0 85.4
MMVU 67.4 72.0 77.9 81.2 76.6
MLVU (M-Avg) 53.4 -- 84.7 87.6 87.4
TVBench 61.5 -- 73.0 83.2 78.2
LVBench 67.3 -- 75.1 78.8 76.2
LVBench (w/ Mem.) 84.3 90.1 -- 84.2 74.5
EgoLife (w/ Mem.) 78.3 82.3 -- 70.8 68.8
VideoDR (w/ Search) 65.6 77.1 -- 71.3 41.0

与K3的对比,K3在编程方面还是略胜,Qwen胜在多模态:


PS:不知道token plan的优惠会持续多久

果然正式版优惠没了 按照API价格换算积分 只有夜间5折 用不起了

最新回复 (19)
  • DeH40 Sung 08-03 10:12
    1

    max 这次竟然开源了?我记得 max 很久不开源了

  • calendar 08-03 10:13
    2

    为什么不放测评啊,qwen 不是说擅长刷榜吗 ^-^

  • F00XXX 08-03 10:13
    3

    这模型现在进化到什么水平了,刚出的时候在web上试了一下很一般啊。

  • fengchris 楼主 08-03 10:13
    4

    Max从没开过源吧

    K3让阿里老实了 被迫开源 不然开源宝座坐不了了

  • 源程 08-03 10:16
    5

    啥情况,阿里的qwen3.8 max竟然开源,这没记错应该是多模态模型呀。

  • HeriX 08-03 10:21
    6

    居然是2.4T的大模型吗, 但是感觉能力有点对不上他这个规模

  • dvdbv 08-03 10:21
    7

    qwen小模型开源越来越少,每次模型发布都没什么存在感了,就像中规中矩的同学连最后的特长都很少玩了一样

  • Integer 08-03 10:23
    8

    3.7就很多没开源了,阿里想的挺好想搞闭源模型挣钱,可是能力不行啊

  • Payaso 08-03 10:23
    9

    qwen最新系列的模型对标GPT哪个版本啊,感觉除了小参数模型本地部署外,存在感好低

  • fengchris 楼主 08-03 10:26
    10

    QWEN3.8-27B的要开源了 再不开小模型要让gemma-4占全了

  • fengchris 楼主 08-03 10:26
    11

    Max可是对标Sol跟Fable的

  • dvdbv 08-03 10:28
    12

    还是太大了,以前各种尺寸都有的,怀念^-^

  • a3members 08-03 10:32
    13

    看这个代码分数好像也不咋地 opus 4.8水平

  • 利陆都2253 08-03 10:32
    14

    期待 qwen 这次能超越 Fable 5 和 GPT 5.6 Sol,毕竟 Fable 5 已经发布快 2 个月了

  • b9348 08-03 10:34
    15

    不是我黑qwen, 但上次preview38也是高分, 结果实际上发和测是两个模型, 我是没见过站里有人吹的,只见过有人黑的, 各种说qwen3.8不行

  • fengchris 楼主 08-03 10:35
    16

    上次说是测试的时候放错了权重 希望这次正式版能名副其实了


    不过Qwen一向都有点过度刷分 能超过GLM-5.2就不错了

  • troubleman 08-03 10:36
    17

    preview这次是发正式版吗?我记得之前一直是preview

  • a12908 08-03 10:37
    18



    qwen每次的官方跑分水分都大得很 在站内基本无人问津 不像K3和v4都能把站干卡咯

    到时候看看这所谓的直逼肥波5max到底能不能打过v4f吧

  • jerry wu 08-03 10:37
    19

    人工智能大会一把手定调了。。不管你想不想,都得开

* 帖子来源Linux.do
返回