GPT-Load 接入 Jev:模型及思考强度的自动挡功能

tbphp 2026-09-21 09:04 1

项目地址: https://github.com/tbphp/gpt-load


最近折腾了一下 Jev ,感觉没有 X 上吹得那么神,准确度还有待提高,不过确实有很多有意思的玩法,特别是针对我在做的 GPT-Load 项目,马上就能想到一个场景:Auto Model 。


目前 GPT-Load 新版加了个 自动模型 功能:让 Jev 判断这次任务适合哪一档,自动调度,省掉本地手动切换模型、思考的操作。

Jev 负责选档,真正思考和输出的还是配置好的预设模型。



目前已经支持 typesafe.ai 官方和 OpenRouter 的 Jev 渠道。



怎么用



  1. 新建 Jev 官方或 OpenRouter 分组填好密钥,配置好 jev 模型。

  2. 在全局设置里找到「实验性功能 → 自动模型」,开启并选择前面配置的 jev 模型。

  3. 可以先用默认的 4 档预设,再调整每档的目标模型、思考强度,以及档位的描述提示词。

  4. 客户端把模型设为 auto ,正常发请求即可。( auto 模型可自定义)



auto 路由、决策、命中哪一档、判断花了多久、决策费用是多少,都能在日志里看到。



一起来实验


当然,调用 Jev 是会增加判断耗时和费用(目前观察费用极低,不过耗时要看任务输入和网络链路延迟),选档精准度还需要调教。不过有回退兜底机制,不会阻塞整个请求。

佬友们有好用的预设,或者遇到选档不合理的情况,欢迎讨论。对功能设计、判断机制有建议,也请不吝指教。

希望能让 Auto 做到真的好用的自动挡,从而从实验变成正式功能。

最新回复 (18)
  • sampeng 09-21 09:46
    1
    自动模型会导致缓存失效,thinking 倒是可以,不过一般般,因为准确度也并不高
  • Haku 09-21 09:56
    2
    这玩意是不是适合做游戏 AI ?游戏 AI 本质上还是做选择题做决策,就算需要沟通也可以生成针对问题的文字。
    能把一些小的模型改成 jev 相同架构的吗?
  • 581996 09-21 10:01
    3
    一直在用 相比较 sub2api 来说 比较轻量
  • qiuhang 09-21 10:10
    4
    @Haku 场景上挺适合的,可惜不开源,没法直接嵌入到本地无限用。游戏直接依赖外部商业 api 还是太昂贵和不可靠了
  • penisulaS 09-21 10:16
    5
    jev 是不是本质上是个小模型,所以速度快
  • tbphp 楼主 09-21 10:19
    6
    @sampeng 是存在这个问题,我也考虑过。

    同一个任务(非会话)会自动沿用,避免多次请求都判断,但是不同的任务(主动发送消息)会触发判断。
    使用的场景也有这种情况,同一个会话,但是在处理不同阶段也会切模型思考。
  • sampeng 09-21 10:24
    7
    @tbphp 切思考没什么问题。我建议在一次 session 下不要切模型。收益太低了。cache 低意味着飞快的消耗配额。
  • tbphp 楼主 09-21 10:30
    8
    @sampeng 但实际上会话中不同的指令需要不同的模型,也是很高的需求。
    嗯,目前实验性功能就是希望搜集下大家的反馈,看下后续如何优化和调整吧,或者考虑给一些控制选项。
  • fds 09-21 10:34
    9
    @penisulaS #5 输出也少,就几个数
  • xialaoban 09-21 10:38
    10
    完全改版了啊。。
    我部署的还是老版本
  • musi 09-21 11:07
    11
    @sampeng #1 thinking 其实也会导致缓存失效,因为很多模型的思考程度是要在系统提示词前注入不同的提示词/标签实现的

    deepseek-v4-flash: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/encoding/encoding_dsv4.py
    glm-5.3: https://huggingface.co/zai-org/GLM-5.3/blob/main/chat_template.jinja
  • sampeng 09-21 11:21
    12
    @musi 还真是,我用 deepseek 测试了一下。。国产的好像都是这样
  • musi 09-21 11:23
    13
    @sampeng 国外的也这样: https://x.com/thsottiaux/status/2088729222777094624
  • tbphp 楼主 09-21 11:28
    14
    @musi 是的,不同厂商的模型策略不同。是否需要自动挡,还是要看自己的工作流、上游情况来尝试。
  • sampeng 09-21 11:58
    15
    @musi 靠。。果断去乖乖把自动 thinking 的功能去掉。。那就屁用没有了。。
  • yh7gdiaYW 09-21 14:53
    16
    @tbphp openai 就是这种策略,所以你折腾的这个无意义
  • tbphp 楼主 09-21 17:20
    17
    @yh7gdiaYW 他那是直接降智,不是根据输入自动路由。
  • yh7gdiaYW 09-21 17:48
    18
    @tbphp 我说的是 openai 也是用 prompt 控制思考强度,你自动路由就会破坏缓存,搞这个没有意义反而不如一直用高一点的档位
* 帖子来源V2EX
返回