先说结论:GLM-5.3-Flash High 常驻 → 难题 GLM-5.3 High → 极难题 GLM-5.3 Max
来看一下官方发的比较图:

这张图其实是在比较:不同模型在投入更多“输出 token / 推理 effort”之后,Agentic Coding(代理式编程任务)的准确率能提升多少。
按照 glm-5.3 耗用量是 glm-5.3-flash 3 倍来粗略计算(这里不太严谨):
方案 |
平均输出 Tokens |
Accuracy |
相对成本(Flash = 1x) |
|---|
GLM-5.3-Flash Low |
~42K |
~21.5% |
~42 |
GLM-5.3-Flash High |
~71K |
~28.1% |
~71 |
GLM-5.3-Flash Max |
~139K |
~29.0% |
~139 |
GLM-5.3 Low |
~49K |
~24.6% |
~147 |
GLM-5.3 High |
~51K |
~31.3% |
~153 |
GLM-5.3 Max |
~75K |
~34.5% |
~225 |
能看出 Flash Max 的性价比其实比较尴尬。
Flash High → Max: 成本约 +96%,准确率只 +0.9 百分点。
而 Flash High → GLM-5.3 High: 成本约 +115%,准确率 +3.2 百分点。
所以如果一个任务已经难到你准备给 Flash 开 Max,我会更倾向于:
Flash High → 直接换 GLM-5.3 High
而不是:
Flash High → Flash Max。
当然这里是按图里的平均 output tokens × 约 3 倍单价做的粗算,实际成本还要看输入/输出和缓存。
综上,一个比较乐观的方案是采用 “Flash High 常驻 → 难题 GLM-5.3 High → 极难题 GLM-5.3 Max” 这三级策略。这样 Flash Max 基本可以跳过。
另外图里 GLM-5.3 Low → High 几乎没有增加 token(约 49K→51K),但准确率 24.6%→31.3%,对比 Flash high,没有性价比可言。 所以现在使用 GLM-5.3,将没有理由开 Low(应该也没人开)。