• 请不要在回答技术问题时复制粘贴 AI 生成的内容
tbphp
V2EX  ›  程序员

GPT-Load 接入 Jev:模型及思考强度的自动挡功能

  •  
  •   tbphp · 21h 10m ago · 2190 views

    项目地址: https://github.com/tbphp/gpt-load

    最近折腾了一下 Jev ,感觉没有 X 上吹得那么神,准确度还有待提高,不过确实有很多有意思的玩法,特别是针对我在做的 GPT-Load 项目,马上就能想到一个场景:Auto Model 。

    目前 GPT-Load 新版加了个 自动模型 功能:让 Jev 判断这次任务适合哪一档,自动调度,省掉本地手动切换模型、思考的操作。
    Jev 负责选档,真正思考和输出的还是配置好的预设模型。

    目前已经支持 typesafe.ai 官方和 OpenRouter 的 Jev 渠道。

    怎么用

    1. 新建 Jev 官方或 OpenRouter 分组填好密钥,配置好 jev 模型。
    2. 在全局设置里找到「实验性功能 → 自动模型」,开启并选择前面配置的 jev 模型。
    3. 可以先用默认的 4 档预设,再调整每档的目标模型、思考强度,以及档位的描述提示词。
    4. 客户端把模型设为 auto ,正常发请求即可。( auto 模型可自定义)

    auto 路由、决策、命中哪一档、判断花了多久、决策费用是多少,都能在日志里看到。

    一起来实验

    当然,调用 Jev 是会增加判断耗时和费用(目前观察费用极低,不过耗时要看任务输入和网络链路延迟),选档精准度还需要调教。不过有回退兜底机制,不会阻塞整个请求。
    佬友们有好用的预设,或者遇到选档不合理的情况,欢迎讨论。对功能设计、判断机制有建议,也请不吝指教。
    希望能让 Auto 做到真的好用的自动挡,从而从实验变成正式功能。

    Supplement 1  ·  19h 6m ago
    ## 关于模型切换与缓存的讨论

    切换模型会导致缓存失效,所以这个实验性功能是有一定代价的。
    目前做了一些优化,保证同一个指令(不是会话)会保证沿用,不会每次请求都进行判断。这样保证一个任务只进行判断一次,也避免模型切换。

    但是会话中多个指令会根据预设的提示词进行判断。

    比如场景:在一个会话中进行方案设计、架构沟通期间会用高档位。方案确定后开始实施会切普通档。损失一次缓存,也能保证质量和成本。

    而且预设是用户自己填写的,切换时机通过预设提示词来控制。
    比如以上场景,可以在预设中明确方案沟通设计使用高档,编码实施等任务使用普通档位。

    自动挡肯定没有手动挡精准,这是不可避免的。就比如我们开始也有自动和手动的选择,根据自己需要选择对应的模式即可。
    19 replies    2026-09-22 00:21:15 +08:00
    sampeng
        1
    sampeng  
       20h 29m ago via iPhone   ❤️ 1
    自动模型会导致缓存失效,thinking 倒是可以,不过一般般,因为准确度也并不高
    Haku
        2
    Haku  
       20h 18m ago
    这玩意是不是适合做游戏 AI ?游戏 AI 本质上还是做选择题做决策,就算需要沟通也可以生成针对问题的文字。
    能把一些小的模型改成 jev 相同架构的吗?
    581996
        3
    581996  
       20h 13m ago
    一直在用 相比较 sub2api 来说 比较轻量
    qiuhang
        4
    qiuhang  
       20h 4m ago   ❤️ 1
    @Haku 场景上挺适合的,可惜不开源,没法直接嵌入到本地无限用。游戏直接依赖外部商业 api 还是太昂贵和不可靠了
    penisulaS
        5
    penisulaS  
       19h 59m ago
    jev 是不是本质上是个小模型,所以速度快
    tbphp
        6
    tbphp  
    OP
       19h 56m ago
    @sampeng 是存在这个问题,我也考虑过。

    同一个任务(非会话)会自动沿用,避免多次请求都判断,但是不同的任务(主动发送消息)会触发判断。
    使用的场景也有这种情况,同一个会话,但是在处理不同阶段也会切模型思考。
    sampeng
        7
    sampeng  
       19h 50m ago
    @tbphp 切思考没什么问题。我建议在一次 session 下不要切模型。收益太低了。cache 低意味着飞快的消耗配额。
    tbphp
        8
    tbphp  
    OP
       19h 44m ago
    @sampeng 但实际上会话中不同的指令需要不同的模型,也是很高的需求。
    嗯,目前实验性功能就是希望搜集下大家的反馈,看下后续如何优化和调整吧,或者考虑给一些控制选项。
    fds
        9
    fds  
       19h 40m ago
    @penisulaS #5 输出也少,就几个数
    xialaoban
        10
    xialaoban  
       19h 36m ago
    完全改版了啊。。
    我部署的还是老版本
    musi
        11
    musi  
       19h 8m ago
    @sampeng #1 thinking 其实也会导致缓存失效,因为很多模型的思考程度是要在系统提示词前注入不同的提示词/标签实现的

    deepseek-v4-flash: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/encoding/encoding_dsv4.py
    glm-5.3: https://huggingface.co/zai-org/GLM-5.3/blob/main/chat_template.jinja
    sampeng
        12
    sampeng  
       18h 53m ago
    @musi 还真是,我用 deepseek 测试了一下。。国产的好像都是这样
    musi
        13
    musi  
       18h 51m ago
    tbphp
        14
    tbphp  
    OP
       18h 46m ago
    @musi 是的,不同厂商的模型策略不同。是否需要自动挡,还是要看自己的工作流、上游情况来尝试。
    sampeng
        15
    sampeng  
       18h 17m ago
    @musi 靠。。果断去乖乖把自动 thinking 的功能去掉。。那就屁用没有了。。
    yh7gdiaYW
        16
    yh7gdiaYW  
       15h 21m ago
    @tbphp openai 就是这种策略,所以你折腾的这个无意义
    tbphp
        17
    tbphp  
    OP
       12h 54m ago
    @yh7gdiaYW 他那是直接降智,不是根据输入自动路由。
    yh7gdiaYW
        18
    yh7gdiaYW  
       12h 27m ago
    @tbphp 我说的是 openai 也是用 prompt 控制思考强度,你自动路由就会破坏缓存,搞这个没有意义反而不如一直用高一点的档位
    tbphp
        19
    tbphp  
    OP
       5h 54m ago
    @yh7gdiaYW 在浏览 x 上的时候,有很多类似需求。并且也手到了对应的 issue 。
    需求确实存在,也不仅是单个渠道上游,只考虑缓存成本问题。
    有些人的场景是有多个上游渠道的,用户会习惯不同的模型去适配不同的场景,不同渠道模型的能力也不同。
    很多场景也是我考虑不到的,这些都交予用户多一个选择。

    毕竟也是实验性功能,也是因为具体场景未知,希望得到用户一些反馈和体验。再进行后续的计划。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   993 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 35ms · UTC 22:15 · PVG 06:15 · LAX 15:15 · JFK 18:15
    ♥ Do have faith in what you're doing.