GPT-Load 接入 Jev:模型及思考强度的自动挡功能

唐洛 2026-09-21 10:02 1



开源推广发帖模板

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出





项目主贴: 🔥 GPT-Load 2.0 发布!!!轻量易用的自托管 AI 网关

项目地址: GitHub - tbphp/gpt-load: Self-hosted AI gateway for multi-channel, multi-credential setups — API keys and subscription accounts, scheduling, failover, request logs and usage. 自托管 AI 网关:多渠道多凭据统一接入,含密钥与订阅账号、调度容错、日志与用量。 · GitHub


最近折腾了一下 Jev,感觉没有 X 上吹得那么神,准确度还有待提高,不过确实有很多有意思的玩法,特别是针对我在做的 GPT-Load 项目,马上就能想到一个场景:Auto Model 。


目前 GPT-Load 新版加了个 自动模型 功能:让 Jev 判断这次任务适合哪一档,自动调度,省掉本地手动切换模型、思考的操作。

Jev 负责选档,真正思考和输出的还是配置好的预设模型。



目前已经支持 typesafe.ai 官方和 OpenRouter 的 Jev 渠道。





怎么用



  1. 新建 Jev 官方或 OpenRouter 分组填好密钥,配置好 jev 模型。

  2. 在全局设置里找到「实验性功能 → 自动模型」,开启并选择前面配置的 jev 模型。

  3. 可以先用默认的4档预设,再调整每档的目标模型、思考强度,以及档位的描述提示词。

  4. 客户端把模型设为 auto,正常发请求即可。(auto 模型可自定义)



auto 路由、决策、命中哪一档、判断花了多久、决策费用是多少,都能在日志里看到。



一起来实验


当然,调用 Jev 是会增加判断耗时和费用(目前观察费用极低,不过耗时要看任务输入和网络链路延迟),选档精准度还需要调教。不过有回退兜底机制,不会阻塞整个请求。

佬友们有好用的预设,或者遇到选档不合理的情况,欢迎讨论。对功能设计、判断机制有建议,也请不吝指教。

希望能让 Auto 做到真的好用的自动挡,从而从实验变成正式功能。

最新回复 (19)
  • Neo 09-21 10:03
    1

    openai 的降智方案是你做的吧?

  • gogo 09-21 10:03
    2

    原来是你搞砸了一切!

  • 全栈小菜鸡 09-21 10:04
    3

    其实一出也有这种想法,有点马后炮的感觉。。哈哈

  • shock 09-21 10:04
    4

    其实, 我在想,


    多专家模型。 本身应该就内置了这玩意。只是没通用化开放出来。

  • Tibo Sottiaux 09-21 10:05
    5

    嚯,这都被你发现了 ^-^

  • bad_egg 09-21 10:05
    6

    价格是多少?在哪里可以用?不是幻觉嘛?

  • aha 09-21 10:06
    7

    cdk的bug怎么还没修

  • laki 09-21 10:07
    8

    得到了始皇的辣评

  • dotwf 09-21 10:14
    9

    这样搞不是缓存也没了?

  • 唐洛 楼主 09-21 10:14
    10

    哈哈哈哈,冤枉啊。

    我这是自动挡,openai 那只有降档。

  • 唐洛 楼主 09-21 10:16
    11

    同一个任务(不是会话),会自动沿用。但是一个会话多次任务是会触发判定。

  • dotwf 09-21 10:17
    12

    就是啊,要是被判定换了模型,这不是缓存就无了

  • 唐洛 楼主 09-21 10:21
    13

    同一个会话里面不同任务也会手动切啊,所以这就是自动挡和手动挡的区别和选择。

    也要根据自己的场景调整预设提示词。


    就跟开车一样,自动挡肯定没法像手动挡那样精准,但好在方便。

  • Cry 09-21 10:36
    14

    这次是t佬搞砸了一切,我还有证据,t佬有openai给的20x pro,他一定是内部人员 ^-^

  • 09-21 10:39
    15

    我这个降智的pro20怎么恢复呢?

  • 唐洛 楼主 09-21 10:40
    16

    额,这超出了当前项目的范畴了。。。

  • dotwf 09-21 10:47
    17

    提个建议啊,不要覆盖user-agent,客户端的ua应该透传,现在被改成GPT-Load/v2.0.0

  • wwwoook 09-21 10:48
    18

    哈哈哈,自动降挡。 ^-^

  • 义演丁真 09-21 10:48
    19

    但是session中途切模型/thinking effort 不会导致cache miss吗(

* 帖子来源Linux.do
返回