低估了luna max,之前做的codex自动选模型skill又要返工了

WeakOrange 2026-08-02 15:06 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出




前天luna降价80%,我才认真看了一遍luna的cursorbench和chatbench数据,发现terra才是最大输家^-^


比如chatbench agent-task里,luna max的分数超过了terra max和glm-5.2 max;cursorbench基于大量真实coding任务,luna max的正确率甚至高于codex默认的sol medium。


成本差距就更夸张了,luna基本是断崖式领先。能与之一战的也就deepseek v4 flash,但luna是多模态模型。


之前做了个skill:$codex-auto-model-router,根据任务难度自动拆分子任务选择模型,并且并发执行。


一开始是让sol设计了方案,luna low分给机械、重复的小任务。即使这样还是容易出错,比不过写个脚本来重复,我当时把问题归结为luna能力不够。


单看测评数据,luna high其实已经有不错的正确率,而且tokens和steps明显少于max,理论上速度和成本都会更好。我自己常用的iOS开发和数据整理的workflow也都设计了几个对比测试,都能够降本增效提速。


又调整一波路由和并发的逻辑:








































路由 默认用途
Luna medium 所有机械与重复任务;自动路由不再低于此档
Luna high 有界普通任务的默认档
Luna max 确实较深或较大、且能接受延迟的确定性任务
Terra high 显式强调低延迟,且更看重较短推理链而非 Luna/high 质量时
Sol medium 有界复杂任务
Sol high 高歧义、高耦合、判断型验证或高后果任务
Sol xhigh 复杂任务已有失败,或用户明确指定

当然,benchmark不等于真实开发体验,我还会继续用实际任务测试不同档位。


项目地址:




欢迎大家分享一下luna high/max的实际体验,尤其想知道它在哪些任务上最容易翻车。

最新回复 (2)
  • 40老汉敲代码 @codex_reset 08-02 15:08
    2

    luna 降价 确实没人用 terra 了 ^-^

  • mi tu 08-02 15:35
    3

    但是luna还是太小了,很多需要直觉和知识量的场景就不太行,而且进行轮次太多很慢,又快又便宜又好的模型真的很难找,我感觉之前的grok4.5算一个 ^-^

* 帖子来源Linux.do
返回