jinsongzhaocn
V2EX  ›  Local LLM

部署 Qwen3.8-27B 模型死循环问题最新升级

  •  
  •   jinsongzhaocn · 23 days ago · 1254 views

    部署 Qwen3.8-27B 模型的朋友,死循环问题可以升级了。 https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates llama.cpp 的配置参数里指定模板文件:

    --jinja --chat-template-file /model/Qwen3.8-27B/chat_template.jinja --reasoning-format deepseek

    6 replies  •  2026-09-30 09:56:15 +08:00
    liangyuan1985
        1
    liangyuan1985  
       22 days ago
    Qwen3.6-27B 就用了
    jinsongzhaocn
        2
    jinsongzhaocn  
    OP
       22 days ago
    @liangyuan1985 几天前更新了一些 think 部分的内容,不知道替换后效果如何?
    tgfbeta
        3
    tgfbeta  
       17 days ago
    上 flash next 吧,q3 跑了超 24hr 还没崩坏呢
    jinsongzhaocn
        4
    jinsongzhaocn  
    OP
       15 days ago
    @tgfbeta 只有一片 4090 24GB ,64GB 内存. flash next 16tok/s 太慢了,就算升级到 192GB 内存,只可能到 30-40tok/s, 而且 flash next 对 agent 来说反而降了,编程评分在我的机器上测试,比 27b 低了 10%。 我用的是 flash next Q4_M_XL, KV q8 。
    tgfbeta
        5
    tgfbeta  
       8 days ago
    @jinsongzhaocn 24GB 是差点,96GB 应该够了,比如两张 4090 48G 。vllm 的并发可能更好一点,至少在 DGX spark 上是的,同时跑两路生成就能接近翻倍。
    jinsongzhaocn
        6
    jinsongzhaocn  
    OP
       12h 10m ago
    @tgfbeta 我以前也一直用 vllm ,但是资源不够,还是用 gguf 比较好,llama.cpp 可玩的新技术多很多,不知道 SGLang 如何,据说擅长 Agent 长任务
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2605 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 26ms · UTC 14:06 · PVG 22:06 · LAX 07:06 · JFK 10:06
    ♥ Do have faith in what you're doing.