本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:
- 我的帖子已经打上 开源推广 标签: 是
- 我的开源项目完整开源,无未开源部分: 是
- 我的开源项目已链接认可 LINUX DO 社区: 是
- 我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是
- 以上选择我承诺是永久有效的,接受社区和佬友监督: 是
以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出
前天luna降价80%,我才认真看了一遍luna的cursorbench和chatbench数据,发现terra才是最大输家^-^
比如chatbench agent-task里,luna max的分数超过了terra max和glm-5.2 max;cursorbench基于大量真实coding任务,luna max的正确率甚至高于codex默认的sol medium。
成本差距就更夸张了,luna基本是断崖式领先。能与之一战的也就deepseek v4 flash,但luna是多模态模型。
之前做了个skill:$codex-auto-model-router,根据任务难度自动拆分子任务选择模型,并且并发执行。
一开始是让sol设计了方案,luna low分给机械、重复的小任务。即使这样还是容易出错,比不过写个脚本来重复,我当时把问题归结为luna能力不够。
单看测评数据,luna high其实已经有不错的正确率,而且tokens和steps明显少于max,理论上速度和成本都会更好。我自己常用的iOS开发和数据整理的workflow也都设计了几个对比测试,都能够降本增效提速。
又调整一波路由和并发的逻辑:
路由 |
默认用途 |
|---|
Luna medium |
所有机械与重复任务;自动路由不再低于此档 |
Luna high |
有界普通任务的默认档 |
Luna max |
确实较深或较大、且能接受延迟的确定性任务 |
Terra high |
显式强调低延迟,且更看重较短推理链而非 Luna/high 质量时 |
Sol medium |
有界复杂任务 |
Sol high |
高歧义、高耦合、判断型验证或高后果任务 |
Sol xhigh |
复杂任务已有失败,或用户明确指定 |
当然,benchmark不等于真实开发体验,我还会继续用实际任务测试不同档位。
项目地址:
欢迎大家分享一下luna high/max的实际体验,尤其想知道它在哪些任务上最容易翻车。