davinci21s

可能很快就能实现 token 自由了

  •  
  •   davinci21s · 16h 35m ago · 2324 views

    qwen3.8 开源,性能比肩 opus4.6 ,之后出现几百个版本。

    目前量化版本从 1bit 到 16bit ,最低 8G 内存 mac 即可运行

    想要获得不错的体验建议 3080 以上显卡

    传送门: https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

    🎉 16G 丐版 M1 部署 Qwen 3.8-27B 实测报告:

    不出意外,打字机效果,不过智商还可以😄

    📊 实测配置与数据

    设备:MacBook Pro ( M1 / 16GB ) 模型:Qwen3.8-27B ( UD-Q2_K_XL ,9.15GB ) GPU:全层 Metal 卸载 内存:稳定在 11 GB 左右 首 Token 延迟:约 850ms 预填充速度:10 ~ 12.5 tok/s 生成速度:约 4 tok/s

    几点调优心得👇🏻

    1. M1 的瓶颈主要是内存带宽 M1 内存带宽仅 68 GB/s ,每生成一个 Token 必须将 9.15G 权重通读一遍。4 tok/s 已经榨干了 M1 物理带宽的 60% 极限!

    2. 按场景切换思考模式 Qwen3.8 原生自带深度思考链。日常对话通过调参关闭思考,跳过思考链直出答案,体验极其干脆;写复杂算法时开启思考,逻辑推导依然在线。

    3. 用投机采样继续提速

    叠加 --flash-attn on + -ctk q8_0 + --spec-type ngram-simple 投机采样,写代码与结构化文本时,速度能飙到 5.5+ tok/s

    结论:老 M1 还能再战三年!✌🏻

    15 replies    2026-08-20 23:31:10 +08:00
    wjxd
        1
    wjxd  
       16h 14m ago
    准备拿 win10 系统,amd 7900xt 20G ,跑 Qwen3.8-27B-UD-Q4_K_M.gguf
    siriusliangcn
        2
    siriusliangcn  
       15h 35m ago
    我看 command code 套餐里上架了 qwen3.8:27b 模型,输入价格 0.4 刀,跟 DeepSeek-v4-flash 的波峰 0.44 波谷 0.22 不相上下。这种 27b 的模型真的能硬撼云端大模型了吗?
    没开源的时候,我就在想这个事情,但是看论坛里大家吹得那么牛,还是不太敢相信。
    davinci21s
        3
    davinci21s  
    OP
       15h 32m ago
    @siriusliangcn 有人和 sol 、fable5 、opus5 ,做过对比,基本吻合
    siriusliangcn
        4
    siriusliangcn  
       15h 17m ago   ❤️ 1
    也就是说,真的有人愿意用 0.4 的价格使用 qwen3.8-27b ,也不用 0.44 的价格使用 ds4flash ?卧槽…ds 真的拉完了啊…
    levn
        5
    levn  
       15h 12m ago
    实现写 bug 自由还差不多
    minami
        6
    minami  
       15h 6m ago   ❤️ 1
    5.5+ tok/s 叫 token 自由,意义不亚于限速 10 kb/s 的百度网盘
    foryou2023
        7
    foryou2023  
       15h 5m ago
    ds4 flash 要达到日常能用的标准,需要投入多少硬件成本呢
    ntdll
        8
    ntdll  
       15h 2m ago
    在 transform 架构没有改变的情况下,基本还是遵守一寸长一寸强的基本逻辑。

    参数量小,意味着其只有更为泛化的知识,因此非常依赖上下文给足背景信息,但是你在自己设备上跑,通常配置都很一般,导致上下文也很小。结果就是,LLM 大概率是输出正确的废话。也就是车轱辘话。
    HK560
        9
    HK560  
       14h 54m ago
    5090dv2 已跑,但确实打字机速度还是挺难受的。
    davinci21s
        10
    davinci21s  
    OP
       14h 40m ago
    @HK560 应该不至于啊,是不是版本不对,目前已经出现很多优化版本。试一下上面最新的。
    HK560
        11
    HK560  
       14h 1m ago
    @davinci21s #10 跑的这个 https://huggingface.co/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF
    没怎么研究过,就和我平时打字速度差不多快一点点
    fe619742721
        12
    fe619742721  
       13h 52m ago
    32g m5 air 能跑出多少速度呢,感觉 15-20tokens/s 是不是就可以接受了
    davinci21s
        13
    davinci21s  
    OP
       12h 16m ago
    @fe619742721 应该是大于这个速度的
    skull
        14
    skull  
       9h 54m ago via iPhone
    用 deepseek flash 200 tok/s 比这个 5.5 免费好太多了吧,非特殊场景基本不考虑
    Jacobson
        15
    Jacobson  
       7h 45m ago via iPhone
    @wjxd 双 5060ti 16g 跑这个只有 23 的速度😂
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1136 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 33ms · UTC 23:16 · PVG 07:16 · LAX 16:16 · JFK 19:16
    ♥ Do have faith in what you're doing.