没大量实测过,但在perplexity上问过ai,下面ai回答实录(纯是grok的回答):
deepseek v4 flash 0731和gpt-5.6-luna max,哪一个性能更强?
综合智力几乎打平:两边在 Artificial Analysis Intelligence Index 上都是 52。Luna Max 在 agent、多模态和吞吐上略强;Flash 0731 在开源、首字延迟和官方单价上更划算。[^1_1]
注意:没有单独的「GPT-5.6-Luna Max」型号。它是 GPT-5.6 最便宜的 Luna 档,把推理力度开到 max。[^1_2]
定位差异
维度 |
DeepSeek V4 Flash 0731 |
GPT-5.6 Luna Max |
|---|
本质 |
正式 GA 版,284B 总参 / 13B 激活 MoE |
Luna 档 + max 推理,闭源托管 |
发布 |
2026-07-31 |
2026-07 家族,7 月底降价 |
上下文 |
约 1M,最大输出约 384K |
约 1.05M,最大输出 128K |
输入 |
仅文本 |
文本 + 图像 |
权重 |
开源(MIT) |
闭源 |
综合智力 |
52 |
52 |
Flash 0731 是 4 月预览版的再后训练,编码、推理和 agent 都明显抬升,架构没变。[^1_3][^1_4]
分项谁更强
独立榜和官方榜不要混着读。AA 对 Flash 的 Terminal-Bench 是 79%;DeepSeek 自家是 82.7%。Luna 官方 Terminal-Bench 是 84.7%。[^1_5][^1_6][^1_7]
评测 |
Flash 0731 |
Luna Max |
谁强 |
|---|
AA Intelligence Index |
52 |
52 |
平手 [^1_1] |
Terminal-Bench 2.1 |
79%(AA)/ 82.7%(官方) |
84.7%(官方) |
Luna 略强 [^1_5][^1_6][^1_7] |
GPQA Diamond |
91% |
92.3% |
Luna 略强 [^1_5][^1_8] |
Agents' Last Exam |
25.2%(官方) |
50.3%(官方) |
口径不同,Luna 数字更高 [^1_6][^1_7] |
DeepSWE |
54.4% |
约低于 Sol High 5 分 |
接近,Flash 公开分完整 [^1_6][^1_9] |
真实 SaaS agent(12 题) |
4/12 |
5/12 |
Luna 略强 [^1_10] |
ARC-AGI-2(max) |
61.4% |
未见对等公开分 |
Flash 有硬推理分 [^1_11] |
长上下文召回 MRCR |
未给同等表 |
41.3%(Luna 档悬崖) |
Luna 弱项 [^1_7] |
一个具体例子:建 6 个日历事件时,Luna 是 10/10,Flash 只有 3/10;跨应用改台账两边都没全过。[^1_10]
Flash 0731 相对自家预览版跳得很猛:Terminal-Bench 从 61.8% 到 82.7%,DeepSWE 从 7.3% 到 54.4%。它打的是「同价位最强开源」,不是去压 GPT-5.6 Sol。[^1_6][^1_5]
速度和价格
指标 |
Flash 0731 Max |
Luna Max |
|---|
输出速度 |
117 tok/s |
184 tok/s |
首字延迟 |
1.22s |
116.20s |
AA 综合单价 |
$0.23 / 1M |
$0.17 / 1M |
官方输入/输出 |
$0.14 / $0.28 |
$0.20 / $1.20 |
缓存命中 |
$0.0028(约 98% 折扣) |
约 9 折读缓存 |
Luna 生成更快、AA 综合价更低;Flash 几乎立刻开始吐字,官方输出价大约只有 Luna 的四分之一。AA 按 DeepSeek 官方 API 算,Flash 单任务成本大约比 Luna Max 低 60%,主要靠缓存折扣。[^1_7][^1_1][^1_5]
真实 12 题 SaaS 跑下来,Luna 用时约 51 分钟、约 $0.72;Flash 约 55 分钟、约 $0.82。Flash 单价更低,但这次吃了更多 token。[^1_10]
怎么选
选 Luna Max,如果你要:看图、更稳的工具调用、更高吞吐、少自己运维。它是「同智力档里更好用的托管产品」。[^1_1][^1_10]
选 Flash 0731,如果你要:开源自托管、国内直连、超长输出、极低输出价、首字快。它对编码/agent 已经接近 Luna Max,但不是全面碾压。[^1_3][^1_6]
两边都不是旗舰。要再往上,看 GPT-5.6 Sol / Terra,或 DeepSeek V4 Pro 0813;后者 AA 只比 Flash 0731 高约 1 分,激活参数大约是它的 3.8 倍。[^1_12][^1_7]
gpt-5.5 xhigh和gpt-5.6-luna max,这两个模型哪个更强大?
综合智力还是 5.5 xhigh 更强。Luna Max 是 5.6 最便宜的一档开到满推理,部分 agent 和工作流能咬住甚至反超,但难题推理和长上下文明显更弱。[^3_1][^3_2]
Luna Max 不是单独型号,而是 gpt-5.6-luna 把推理开到 max。官方也写了:Luna 接近 5.5 的峰值,Terra 才稳定超过 5.5。[^3_1]
定位不同
维度 |
GPT-5.5 xhigh |
GPT-5.6 Luna Max |
|---|
世代 / 档位 |
2026-04 旗舰,开到 xhigh |
2026-07 最低档,开到 max |
AA 综合智力 |
56(独立测)/ 54.8(官方表) |
51.2(官方)/ 约 51–52(max) |
官方说法 |
已被 Terra 超越 |
接近 5.5 峰值,成本不到一半 |
上下文 |
约 922K |
约 1.05M,但长文召回崩 |
5.5 是上一代满血大脑;Luna 是新一代小模型,靠更高推理档位把性价比拉满,不是去替换 5.5 的天花板。[^3_2][^3_3][^3_1]
分项谁赢
官方对照表里,5.5 赢在「难、深、长」;Luna 赢在一部分新 agent / 职场任务。
评测 |
5.5 |
Luna |
谁强 |
|---|
AA Intelligence Index |
54.8 / 56 |
51.2 |
5.5 [^3_1][^3_2] |
GPQA Diamond |
93.6% |
92.3% |
5.5 [^3_1] |
FrontierMath T1–3 |
85.3% |
78.6% |
5.5 [^3_1] |
FrontierMath T4 |
72.5% |
58.5% |
5.5,差 14 分 [^3_1] |
Terminal-Bench 2.1 |
85.6% |
84.7% |
5.5 略强 [^3_1] |
Coding Agent Index |
76.4 |
74.6 |
5.5 [^3_1] |
SWE-Bench Pro |
59.4% |
62.7% |
Luna [^3_1] |
DeepSWE |
67% |
67.2% |
基本平 [^3_1] |
Agents' Last Exam |
46.9% |
50.3% |
Luna [^3_1] |
GDPval-AA v2 |
1494 Elo |
1592 Elo |
Luna [^3_1] |
HealthBench |
49.5% |
55.7% |
Luna [^3_1] |
Toolathlon |
55.6% |
53.4% |
5.5 [^3_1] |
BrowseComp |
84.4% |
83.3% |
5.5 略强 [^3_1] |
OSWorld 2.0 |
47.5% |
45.6% |
5.5 略强 [^3_1] |
MRCR 256K–512K |
81.5% |
41.3% |
5.5,Luna 断崖 [^3_1] |
ExploitBench |
47.9% |
33.2% |
5.5 [^3_1] |
一个具体例子:同样读超长文档找针,5.5 还能到八成,Luna 掉到四成。长仓库、多文件、大 PDF 不要用 Luna。[^3_4]
速度和价格
指标 |
5.5 xhigh |
Luna Max |
|---|
API 单价 |
$5 / $30 |
$0.20 / $1.20(7 月 30 日降 80%) |
价差 |
基准 |
输入约便宜 25 倍 |
输出速度 |
约 90 tok/s |
约 180–200 tok/s |
首字延迟 |
约 38s |
max 档会想很久 |
Luna 更便宜、吐字更快;5.5 单次更贵,但难题上少走弯路。[^3_3][^3_2][^3_4]
怎么选
要比「谁更强」,选 5.5 xhigh:综合智力、竞赛数学、科学题、长上下文、安全/漏洞类都更高。
要比「新一代小模型开满后能不能干活」,Luna Max 已经够用:SWE-Bench Pro、Agents' Last Exam、GDPval、医疗题甚至更高,而且便宜一个数量级。
如果你现在就能用 5.6,日常替换 5.5 更合理的是 Terra,不是 Luna。官方写的是 Terra 超过 5.5,Luna 只是接近。[^3_1]
再加上terra xigh做比较
按你点名的档位,综合智力是 5.5 xhigh > Terra xhigh > Luna Max。Terra 要开到 max,才会在官方表上整体超过 5.5;只开 xhigh,独立榜还低于 5.5。[^4_1][^4_2][^4_3]
官方发布表里的「Terra」没写死是 xhigh。独立测:Terra xhigh 是 53,Terra max 才是 55;5.5 xhigh 是 56,Luna max 约 51–52。[^4_2][^4_4][^4_1]
先对齐档位
设置 |
AA 综合智力 |
含义 |
|---|
GPT-5.5 xhigh |
56 |
上一代旗舰接近满档 [^4_4] |
Terra max |
55 |
Terra 真正满档,官方表更接近这一档 [^4_2] |
官方 Terra 列 |
55.0 |
发布稿数字,未标明 xhigh [^4_3] |
Terra xhigh |
53 |
你这次要比的这一档 [^4_1] |
Luna Max |
51–52 |
最低档开满 [^4_2][^4_3] |
5.5 没有对外的 max。Luna 的 max 已经高于 xhigh,Terra xhigh 却还没到自己的顶。所以这组对比里,5.5 和 Luna 都接近各自天花板,Terra 还留了一档。
三分项对照
后两列:官方 Terra / Luna 是发布表;括号里补独立档位。
评测 |
5.5 |
Terra(官方 / xhigh) |
Luna Max |
|---|
AA Intelligence |
56 / 54.8 |
55 官方,53 xhigh |
51.2 |
GPQA Diamond |
93.6% |
92.9% |
92.3% |
FrontierMath T1–3 |
85.3% |
84.9% |
78.6% |
FrontierMath T4 |
72.5% |
68.3% |
58.5% |
Terminal-Bench 2.1 |
85.6% |
87.4% |
84.7% |
Coding Agent Index |
76.4 |
77.4 |
74.6 |
SWE-Bench Pro |
59.4% |
63.4% |
62.7% |
DeepSWE |
67% |
69.6% |
67.2% |
Agents' Last Exam |
46.9% |
50.4% |
50.3% |
GDPval-AA v2 |
1494 Elo |
1593 Elo |
1592 Elo |
BrowseComp |
84.4% |
87.5% |
83.3% |
OSWorld 2.0 |
47.5% |
50.2% |
45.6% |
Toolathlon |
55.6% |
53.1% |
53.4% |
MRCR 256K–512K |
81.5% |
89.6% |
41.3% |
MRCR 512K–1M |
74% |
72.5% |
41.3% |
ExploitBench |
47.9% |
52.9% |
33.2% |
官方 Terra 在编码、agent、浏览、职场任务上超过 5.5;最难的竞赛数学、科学题、Toolathlon 仍略输。Luna 跟 Terra 在 ALE / GDPval 上几乎贴脸,但长上下文直接腰斩。[^4_3]
一个具体例子:同样扫 256K–512K 长文,Terra 89.6%,5.5 81.5%,Luna 只有 41.3%。长仓库、大 PDF 不要用 Luna;Terra xhigh 反而比 5.5 更稳。[^4_3]
速度和价格
指标 |
5.5 xhigh |
Terra xhigh |
Luna Max |
|---|
官方输入/输出 |
$5 / $30 |
现约 $2 / $12(降过 20%) |
$0.20 / $1.20 |
输出速度 |
约 90 tok/s |
122 tok/s |
约 180–200 tok/s |
首字延迟 |
约 38s |
16.8s |
max 会想很久 |
上下文 |
约 922K |
1M |
约 1.05M |
Terra xhigh 是三家里延迟最舒服的一档:比 5.5 便宜一半多,比 Luna 贵一个数量级,但长上下文和难题明显更完整。[^4_1][^4_2][^4_3]
独立榜还有一句难听的:性价比帕累托上,Luna 和 Sol 总压着 Terra。同一预算下,往往能找到一档 Luna 或 Sol,比同价 Terra 更聪明,或一样聪明更便宜。[^4_2]
怎么选
要比「谁更强」:还是 5.5 xhigh。独立综合分最高,难题推理也最稳。
要比「5.6 里谁能替 5.5」:用 Terra max,不要停在 xhigh。官方写的「Terra 超过 5.5」,指的是满档 Terra,不是 xhigh。[^4_3]
Luna Max 只适合高吞吐、短上下文、预算极紧。它能咬住一部分 agent 分,但不是这两位的同级对手。
日常默认:Terra xhigh 做实现,难了再升 Terra max 或换回 5.5 xhigh / Sol。
那我是否可以理解,luna纯粹为了便宜,性能上砍的比较多,可能用来抗衡deepseek flash等开源模型,
这个理解 对了一半。Luna 确实是便宜、走量的一档,市场位置也和 DeepSeek V4 Flash 重叠;但不是「为了便宜把性能砍残」,更不是纯为了打 Flash 才做出来的残血版。[^5_1][^5_2]
便宜是对的
Luna 就是 5.6 里的高并发、低单价层:路由、摘要、打标、重复后台活、简单浏览。7 月 30 日又降了 80%,现在大约 $0.20 / $1.20,ChatGPT 免费档默认也落到它。[^5_3][^5_4][^5_5]
产品结构上也是小模型档。社区和官方对照里,Terra 更接近以前的 Mini,Luna 更接近 Nano,不是缩水版 Sol。[^5_6]
「砍很多」说重了
相对 Sol / Terra,它确实矮一截,尤其是难题和长上下文。相对上一代旗舰 5.5,官方说法是接近峰值、成本不到一半,不是腰斩。[^5_1]
对比 |
实际情况 |
|---|
vs Sol |
综合智力大约 51–52 对 59,这才是真正的档位差 [^5_7] |
vs 5.5 xhigh |
综合低约 3–5 分;SWE-Bench Pro、ALE、HealthBench 甚至更高 [^5_1] |
真被砍的 |
FrontierMath T4(58.5% vs 5.5 的 72.5%)、MRCR 长文掉到 41%、漏洞/安全类 [^5_1] |
没怎么砍的 |
日常编码、agent、职场任务,和 5.5 贴得很近 [^5_1] |
所以它比较像「新一代小模型,开满推理后能干上一代旗舰的活」,不是把 Sol bilibili 式减参减残。
和 Flash 是同价位对手
两边都盯着低成本 agent。独立综合智力都是 52,输入价也挤在同一区间。[^5_2][^5_8]
但 Luna 并没有在单价上打赢 Flash:
|
Luna |
Flash 0731 |
|---|
官方输入/输出 |
$0.20 / $1.20 |
$0.14 / $0.28 |
综合智力 |
52 |
52 |
DeepSWE |
67.2% |
约 53–54% |
真实 SaaS 12 题 |
5/12 |
4/12 |
权重 |
闭源托管 |
开源可自建 |
看图 |
能 |
不能 |
Flash 输出大约便宜 4 倍,还能自托管;Luna 在编码质量和指令遵循上更稳,吞吐也更高。DeepSWE 上 Luna 更准(67% vs 53%),单次大约贵 6 倍,所以有人用「Flash 先打、过不了再升 Luna」更划算。[^5_9][^5_10][^5_2]
7 月底那次大幅降价,很像在这个价位跟开源托管抢量,不是 Luna 这个型号的全部存在理由。[^5_4]
更准确的读法
Luna = 5.6 的走量层,用来把大量简单到中等任务从 Terra/Sol 上卸下来,同时跟 Flash、Gemini Flash 这类便宜模型抢 API 和免费用户。
性能上砍的是天花板和长上下文,不是「不能干活」。日常实现、短仓库、高并发,它够用;难题、超长文档、高风险判断,别指望它扛。
若目标是「尽量便宜还要接近 5.5」,Luna Max 比 Flash 更像 OpenAI 自己的答案;若目标是「能自建、输出极便宜」,Flash 仍然更狠。
GPT-5.6 Luna Max 和gpt-5.5 xhigh同样任务的token消耗量大概差多少
同样任务下,输入差不多,输出 Luna Max 更多。独立同套评测里,Luna Max 的输出(含思考)大约是 5.5 xhigh 的 1.8 倍;发布时按每题均值则大约多 20%。[^6_1][^6_2][^6_3]
差的是推理 token,不是你贴进去的 prompt。思考按输出计价。[^6_4]
同套评测差多少
Artificial Analysis 用同一套 Intelligence Index 跑两边:
口径 |
5.5 xhigh |
Luna Max |
比值 |
|---|
整套输出总量(现行 v4.1.1) |
72M |
130M |
Luna 多约 80% [^6_2][^6_1] |
每题输出均值(7 月 11 日快照) |
16k |
19k |
Luna 多约 19% [^6_5][^6_3] |
每题费用(现行价) |
$1.17 |
$0.05 |
Luna 便宜约 23 倍 [^6_2][^6_1] |
首字延迟 |
38s |
116s |
Luna 想得更久 [^6_2][^6_1] |
更稳妥的读法:同样难度的评测题,Luna Max 大概多吐 20%–80% 输出 token。现行整套总量更偏向 1.8 倍;早期每题均值更接近 1.2 倍。指数改版后,agent 题变多,max 更容易把思考预算用满。[^6_3][^6_1]
别和 xhigh 搞混
max 比 xhigh 多一档思考。Luna 自己 internally 差一截:
档位 |
每题输出 |
整套输出 |
|---|
Luna high |
8k |
37M |
Luna xhigh |
12k |
67M |
Luna Max |
19k |
130M |
5.5 xhigh |
16k |
72M |
所以:Luna xhigh 比 5.5 xhigh 还省一点(约 0.8–0.9 倍);Luna Max 才会明显更费。[^6_6][^6_1][^6_3]
一个具体例子:同一道 Intelligence Index 题,5.5 xhigh 大约 1.6 万输出;Luna xhigh 大约 1.2 万;Luna Max 大约 1.9 万。Max 相对 5.5 多出来的,基本都是隐藏推理。[^6_3]
钱和量是反的
Token 更多,账单仍便宜得多。输出单价 5.5 是 $30/百万,Luna 是 $1.20,差 25 倍;就算 Luna 多用 1.8 倍 token,输出费用仍大约只有 5.5 的 1/14。[^6_7][^6_1]
Codex 订阅里有人觉得 Luna 更吃额度,那是额度按模型加权,不是原始 token 更少。API 按量计费时,Luna Max 仍然远便宜。[^6_8]
官方那句「少 8.5 倍输出」比的是 Luna 对 5.4 mini,不是对 5.5 xhigh,不能拿来估这组。[^6_7]
短、机械的任务两边用量会接近;难题、多工具、开到 Max 时,Luna 更容易把思考预算刷满,输出差距往 1.5–2 倍靠。想接近 5.5 的用量,用 Luna xhigh,不要用 Max。
openai codex的额度,是固定金额的?还是固定token的?
两边都不是。Codex 的额度单位是 credits,再按 token 费率扣;既不是固定美元包,也不是「100 万 token 就是 100 万 token」。[^7_1][^7_2]
2026 年 4 月起,按条计费改成了「token → 积分」对照表。订阅自带额度不公布精确金额或精确 token 数。[^7_3]
实际怎么扣
每条任务拆成输入、缓存输入、输出,分别按百万 token 扣积分。模型越贵,同样 token 扣得越多。[^7_4][^7_1]
模型 |
输入 / 1M |
缓存输入 / 1M |
输出 / 1M |
|---|
GPT-5.6 Sol |
125 |
12.5 |
750 |
GPT-5.6 Terra |
62.5 |
6.25 |
375 |
GPT-5.6 Luna |
25 |
2.5 |
150 |
倍率跟 API 价一样:Terra 是 Sol 的一半,Luna 是五分之一。同样吐 100 万输出 token,Sol 扣 750 分,Luna 只扣 150 分。[^7_4]
官方说 GPT-5.6 大概每条 5–40 分,区间很大:仓库越大、推理越高、工具轮次越多,越往上走。Fast 模式还会再乘倍率。[^7_2][^7_4]
订阅自带的是什么
Plus / Pro 先吃套餐里的 用量池,仪表盘用百分比显示,一般有 5 小时窗口和周封顶。ChatGPT Work、Excel、部分 Workspace Agent 和 Codex 共用这一池。[^7_5][^7_4]
这池子不是固定 token。官方只给「大约能发多少条」的区间,因为每条实际吃多少 token 差很多:
档位 |
Plus 每 5 小时约多少条 |
|---|
Sol |
15–90 |
Terra |
20–110 |
Luna |
50–280 |
Pro 5x / 20x 按 Plus 放大。小改动可能只啃一点,长仓库 + Max 推理一条就能打掉一大截。[^7_6][^7_5]
7 月 12 日曾临时拿掉 5 小时窗,周额度还在。以你账号用量页上的三个表为准:5 小时、每周、付费积分。[^7_5][^7_6]
额外买的才接近「钱」
套餐用完后,Plus / Pro 可以买 credits。积分按 token 表扣,大约 1 分 ≈ 4 美分(比如约 $40 买 1000 分)。这层是「先付钱换成积分,再按加权 token 花掉」。[^7_1][^7_3]
用 API Key 登录则完全按 API 美元计费,不走这套订阅额度。[^7_2]
直观结论
- 不是固定金额包(套餐里没写死本月值多少美元)
- 也不是固定 token 包(100 万 Luna token ≠ 100 万 Sol token)
- 是固定积分预算,按模型和 token 类型加权消耗
所以 Luna Max 虽然单次 token 往往比 5.5 xhigh 多,但积分单价大约只有 Sol / 5.5 的五分之一,同一条订阅额度通常仍能撑更久。[^7_4]
就是说我一个账号的原始额度,用价格更便宜的5.6-luna max,相比较5.5-xhigh,可以多用很多token,对吧?
对。同一账号的原始额度,换成 Luna Max,能花出去的 token 大约是 5.5 xhigh 的 5 倍。[^8_1][^8_2]
Codex 按积分扣,5.5 和 Sol 是同一张价目表,Luna 整表都是它的五分之一。[^8_2][^8_3]
|
5.5 / Sol |
Luna |
同样积分能买到的 token |
|---|
输入 / 1M |
125 分 |
25 分 |
Luna 约 5 倍 |
缓存输入 / 1M |
12.5 分 |
2.5 分 |
Luna 约 5 倍 |
输出(含思考)/ 1M |
750 分 |
150 分 |
Luna 约 5 倍 |
思考 token 按输出计。额度是积分池,不是 token 池,所以便宜模型等于把同一池子换成更多 token。[^8_3]
任务数会少一点
「能多用很多 token」成立;「能多做 5 倍任务」不成立。Luna Max 同一道题往往比 5.5 xhigh 多吐 20%–80% 输出。[^8_4][^8_5]
粗算:积分便宜 5 倍,单次多用约 1.2–1.8 倍 token,完整任务大概能做 3–4 倍。官方区间也接近这个量级:Plus 每 5 小时 Luna 大约 50–280 条,Sol / 5.5 大约 15–90 条。[^8_6]
大仓库、长上下文照样啃输入积分。Luna 只是同样上下文便宜五倍,不是不扣。
想让额度撑最久:用 Luna,但别一直 Max。Luna xhigh 单次 token 往往还少于 5.5 xhigh,积分又便宜五倍,任务数会比 Max 更夸张。[^8_5][^8_3]