coefu
V2EX  ›  Local LLM

mac ultra deepseek harness & qwen3.8-27B 几点经验

  •  
  •   coefu · 7h 29m ago · 486 views
    1 ,不要用 llama.cpp ,虽然它可以超长 context ,并能量化 context ;但是超长 context 一旦处理慢了点,deepseek harness 底层用来连接模型的 pi 就容易超时 hang 住,再次连接的时候,重新 prefill 之前超长的 context 会非常耗时,且 llama.cpp 在同一个 slot 中处理的时候,后续不管 pp/tg 都非常慢。

    2 ,推荐 mlx-dspark ,umem 够的情况下,用 draft 模型,不够,用--lookup-drafts 模式,context 不要搞默认 256k ,有个 64k 足矣,当单个 context 不够,自动切 slot 。前缀缓存( Prefix Caching / KV-Cache Reuse )和 探针验证与 Small-M 优化内核( Small-M Kernel Optimization ),让其能在 context prefill 极速,这是 llama.cpp 的最大问题。后续的 tg 阶段,也提速。虽然没有 context 量化,但是以上技术完全弥补了,且 context 不量化不损失质量。

    3 ,让 dsh 自己写联网插件和记忆插件,保证客观知识的相对准确性,以及多个会话的延续性。
    3 replies    2026-08-19 16:38:49 +08:00
    panas
        1
    panas  
       2h 16m ago
    佬用的哪个量化版本的模型
    coefu
        2
    coefu  
    OP
       2h 1m ago
    @panas mlx-community 的 8 bit ,mlx-dspark 只支持这个。
    coefu
        3
    coefu  
    OP
       1h 21m ago
    mlx-dspark 短 context 情况下,tg 真的是快,一次性蹦出来的。比 llama.cpp 一点点的吐,牛逼太多了。而且在会话中断之后,prefill 就是瞬间完成。llama.cpp 要是在一次会话,context 搞到 200k 左右中断了的话,要继续,光 prefill 之前的 context 都要一两个小时。简直折磨,😩。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4656 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 25ms · UTC 10:00 · PVG 18:00 · LAX 03:00 · JFK 06:00
    ♥ Do have faith in what you're doing.