yiranw09
V2EX  ›  Local LLM

请教一下,本地部署 deepseekV4flash 大概需要什么样的配置需求?

  •  
  •   yiranw09 · 9h 56m ago · 5374 views
    先说明背景,我们公司是半导体公司,我是生产的工程师,并不是信息部门的,但是生产这边有需求,做自己的数据分析跟踪平台,信息部那边又没人力,我们一个实验管理平台拖了半年了还没给我们做好,我拿 llm 自己都 vibe 了一个。
    现在有两个需求都需要用到 ai ,而且因为数据敏感,还必须是纯本地运行。
    一方面试生产工程师开发自己的数据平台需要 ai 做 vibecoding ,另一方面我们希望能用 ai 做数据分析和建模,这方面我们已经悄悄地通过 ai 输出验证了很多东西了
    之前是国产开源的模型能力一般,能力好的模型又太大,部署成本太高,但是近期 deepseekV4flash 的模型量较小,部署成本大幅度降低,能力也完全胜任我们的需求,前段时间的 dflash 技术也让速度能够显著上升。
    想问问有没有本地部署 deepseekV4flash 的方案,我可以借鉴一下
    然后下周拉着我们生产领导去找信息部领导 Battle
    69 replies    2026-08-06 20:48:29 +08:00
    duanxianze
        1
    duanxianze  
       9h 54m ago   ❤️ 1
    你为啥不直接问问 deepseek 呢
    duanxianze
        2
    duanxianze  
       9h 53m ago
    不过我可以提前提醒你一句,目前有钱你都不一定能搞定,到处都在缺货
    OutOfMemery
        3
    OutOfMemery  
       9h 49m ago
    有专门做内网部署的商家,包括硬件,某宝,视频平台可以找找了解一下
    Kinnice
        4
    Kinnice  
       9h 46m ago
    Mac Studio
    - M3 Ultra
    - 256GB 统一内存 推荐 512GB
    - 2TB SSD
    106npo
        5
    106npo  
       9h 45m ago   ❤️ 3
    yiranw09
        6
    yiranw09  
    OP
       9h 42m ago
    @duanxianze #1 问了啊,它给了好几个配置,有 mac studio 128/256 ,有 H100/A100*2 ,有 ada6000*4 ,但是我也不清楚具体效果如何,想问问实际方案和效果,有没有更适合生产的解
    yiranw09
        7
    yiranw09  
    OP
       9h 42m ago
    @duanxianze #2 我也在想这个问题...
    yiranw09
        8
    yiranw09  
    OP
       9h 41m ago
    @OutOfMemery 这要是还找商家我们信息部是真的不用干了 全外包得了
    vandort
        9
    vandort  
       9h 40m ago   ❤️ 5
    自己运行一个 DeepSeek V4 Flash 级别的大模型大概需要 200G 左右的显存,最便宜的方案是 4 个 48G 的 4090 。我不是很确定 4090 跑 DeepSeek V4 Flash 会不会有数据格式上的问题,但如果有问题的话可以选择 DeepSeek V4 Flash W4A*的版本,精度损失比较小,基本是可用的。问题是 48G 的 4090 目前市场上比较少,不一定能找到。如果没货,替代方案是一台 8 卡 5090 的机器。这两种方案都要花大概 30-50 万。还可以买二手的 910B4 ,应该不会超过 70 万。这些是 5 月底的价格,不知道最近涨价没有。我们的业务里包括了给客户提供各种形式的正规的大模型服务的,有需要可以找我们。
    uiosun
        10
    uiosun  
       9h 38m ago
    @vandort 涨了的,六月底咨询工作站,两家还不错的公司,问销售都说涨价了
    yiranw09
        11
    yiranw09  
    OP
       9h 38m ago
    @Kinnice 嘿,现在 Mac studio 涨价也太厉害了,而且 token 输出还是感觉有些慢,加上 mac 不支持 vllm ,而 deepseekv4flash 似乎还没有 MLX 模型吧
    yiranw09
        12
    yiranw09  
    OP
       9h 36m ago
    @106npo 打不开欸,不知道为什么
    106npo
        13
    106npo  
       9h 33m ago
    @yiranw09 应该不用翻墙.不过这样的网站挺多的 ,找个支持计算预期 tps 和 ttft 的网站看吧
    evil0harry
        14
    evil0harry  
       9h 31m ago
    我看有人推荐两台 NVIDIA DGX ,单台 35k 左右
    mzsongyan
        15
    mzsongyan  
       9h 30m ago
    看看 dgx spark
    levn
        16
    levn  
       9h 23m ago
    PRO 6000 x 2
    AAAAAAAAAAAAAAAA
        17
    AAAAAAAAAAAAAAAA  
       9h 19m ago
    个人用和公司很多人用是不一样的,吐字速度跟不上,找个专业的评估一下吧。
    yiranw09
        18
    yiranw09  
    OP
       9h 15m ago
    @AAAAAAAAAAAAAAAA 所以不是来 V 站问问现成的方案嘛,先有个大概我好去 battle (
    Chihaya0824
        19
    Chihaya0824  
       9h 14m ago   ❤️ 1
    别买 mac, PP 拉完了,同理由不推荐 dgx spark/AI max 395 ,除非是愿意等那其实 ok ( 395 问题更大,fp8 都不支持)
    正经用就是最低 2 个 pro 6000 或者 4 个多人大 context
    如果电够多也可以选择 8 个 5090 的方案也行

    @vandort 靠谱,sm80 系列其实就是会有不支持 fp4 的问题,就是没办法跑原版(
    yiranw09
        20
    yiranw09  
    OP
       9h 14m ago
    @evil0harry 似乎可以欸
    yiranw09
        21
    yiranw09  
    OP
       9h 13m ago
    @Chihaya0824 带宽还是太低了是吗?哎,不知道能不能买得到
    Chihaya0824
        22
    Chihaya0824  
       9h 13m ago
    还有别买 pro 6000D ,一买一个不吱声
    Hilalum
        23
    Hilalum  
       9h 13m ago
    https://omlx.ai/compare 这输入模型和芯片可以查到真实部署的 tok/s
    Chihaya0824
        24
    Chihaya0824  
       9h 12m ago
    @yiranw09 不是,Mac 带宽可以的,我说的是 prompt processing 慢,就是你给他大量长文本的时候你要等很久才会开始吐字,以及并发使用的时候会很慢
    yiranw09
        25
    yiranw09  
    OP
       9h 11m ago
    @Chihaya0824 #24 嗷我好像知道咋回事,M3 那会还没有加速单元,M5 才加上的
    Vveeb
        26
    Vveeb  
       9h 7m ago
    > 而且因为数据敏感,还必须是纯本地运行
    我说个题外话, 大清都亡了, 现在中小公司真的有那种很敏感的数据么?
    人家顶尖的 Cyber 模型都已经能发现茫茫多的网络安全漏洞了 (至少人家模型厂商是这么吹的).
    真让人家模型厂商拿到公司的数据了, 这数据对模型厂商有价值么?
    Chihaya0824
        27
    Chihaya0824  
       9h 7m ago
    @yiranw09 是,没有 matmul 加速导致的,但是 m5 也并没有解决什么问题,目前只支持 fp16/bf16/int8 的加速,不恰当的例子你可以理解为他停留在 sm80(A100)时代
    AEDaydreamer
        28
    AEDaydreamer  
       9h 0m ago
    @Vveeb 道理懂技术的人都懂, 更多是制度和合规吧.
    foryou2023
        29
    foryou2023  
       8h 48m ago
    你搜索一下 b 站,我刷到过别人的部署个人使用,个人使用的话,好像 10 万就够了,每秒 Token 在 100 左右好像,不过这个金额记得不是很清楚。
    yiranw09
        30
    yiranw09  
    OP
       8h 46m ago
    @vandort 看了一下,感觉现在这个价格要更贵了...
    yiranw09
        31
    yiranw09  
    OP
       8h 43m ago
    @Vveeb 哎...问题是我们的数据不是那种 ai 会需要的数据,而是在生产行业中很敏感的数据,虽然 ai 不需要,但是会有数据泄露,这个很严重。
    wwhc
        32
    wwhc  
       8h 41m ago
    两块 RTX PRO 6000 ,配置 llama.cpp 用于提供推理服务,满血 v4 flash 也就 160GB 左右。就算是单 RTX 5090 ,也够个人用,输出也可以达到 10-20t/s
    jimrok
        33
    jimrok  
       8h 38m ago
    建议你用生产的样本数据给 ai ,写出分析程序之后,去跑生产数据。这样敏感信息的处理还是自己控制,但分析工具让 ai 给你造。
    GeTLeFt
        34
    GeTLeFt  
       8h 30m ago
    @Vveeb 很多啊,比如金融法律这种涉及用户隐私的
    yiranw09
        35
    yiranw09  
    OP
       8h 28m ago
    @jimrok 问题在于样本数据我都很难发给 ai ,以及生产的数据很复杂,变量影响因素特别多,不给真实数据分析程序是写不明白的,除非我提示词工程能写的特别清晰...但是这个实在是太难了,我们之前偷摸摸用的时候就是这样做的,工程量巨大不说,调试测试也很麻烦,甚至数据还清洗不干净,可是几十万条数据你让我手动清理...哎
    suke119
        36
    suke119  
       7h 51m ago
    @yiranw09 要么 A100 H100 4 张起步 要么昇腾国产系列 8 张起步 优化完速度 30-40 左右 效果还可以 目前我们实践过的 vllm
    lrabbit
        37
    lrabbit  
       7h 50m ago   ❤️ 3
    我前天刚部署了一个,两台 dgx spark,昨天连续跑了一个 7w 多行的 rust 代码,跑了十几亿 token ,总体感觉速度比官方 api 慢 30%,本地大概 50token/s,官方 70-100 token/s 目前 dgx spark 是我觉得最适合部署 deepseek v4 flash 的设备,放在桌面上简直是个艺术品,一点声音也没有,等我多跑几天,后续发个测评
    KOMA1NIUJUNSHENG
        38
    KOMA1NIUJUNSHENG  
       7h 44m ago
    @yiranw09 #8 你可以跟老板报告你拿着 AI 能把信息部的活全揽了,让他把信息部全开了给你涨工资,过两年直接财富自由
    jimrok
        39
    jimrok  
       7h 36m ago
    @yiranw09 确实,你这样的需求非常多,dgx spark 这样的产品未来会是一个主要的形态。苹果,国内的瑞芯微应该都会类似的产品出来。每个办公室都需要一个这样的数字员工,看看打印机的规模,这个市场真是太大了。
    sparkssssssss
        40
    sparkssssssss  
       7h 22m ago
    实测,我们有一台 m3 256G/1T 的版本,ds 刚出圈的时候,买来想着内部跑着试试的,结果,实测,跑个 70b 都勉强,能跑,但是速度很慢,正常用,30b 左右的模型,使用问题不大,但是并发也不行
    我以为用的框架有问题,ollma/vllm/lmstudi 都测试了下,来去不大,不推荐 mac ,能跑,但是仅仅是能跑,
    sky009
        41
    sky009  
       7h 15m ago
    @lrabbit 大佬部署的哪个模型?我看有专门的 DeepSeek-V4-Flash-DSpark 的模型,是否部署的这个版本。
    qishua
        42
    qishua  
       7h 11m ago
    @vandort 哪来的 48G 型号的 4090 ?,我们之前部署用的是 8 卡的 4090 24G 的,部署的是 ds r1
    kakakakaka8889
        43
    kakakakaka8889  
       7h 8m ago
    现在昇腾的卡都不好买到
    Jesens
        44
    Jesens  
       7h 5m ago
    一般来讲 vllm 官网的应该是最准确的: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Flash
    TomatoCLI
        45
    TomatoCLI  
       6h 34m ago
    当生产力的话你就 36 楼说的,当玩具的话你就按上面说的 Mac 部署。
    hafuhafu
        46
    hafuhafu  
       6h 13m ago   ❤️ 1
    首先排除 DGX Spark 这类东西,因为只适合简单实验性探索,没法当生产力。
    要生产力正儿八经弄点显卡跑,看你预算了。正经想要速度和并发,投资不小。
    我 DGX Spark 单台跑了个 Qwen3.6-35B-A3B-FP8 的模型,30-50 的 tok/s 吧。
    跑 Qwen3-VL-8B-Instruct ,10-20 。效果倒是还可以,但是龟速。等完整输出完都猴年马月了。
    下了个量化过的 DeepSeek v4 flash 还没测,看测评也是 10-20 左右。
    flyico
        47
    flyico  
       6h 7m ago   ❤️ 1
    至少需要 70w ,不要盯着最低需求看,能吐字和能流畅的吐字完全是两种产品。
    jlkm2010
        48
    jlkm2010  
       6h 2m ago
    2 张昇腾 950PR 起步,最好是 4 张,如果对吞吐量要求比较高,可以搞一个 8 卡昇腾 950PR 服务器
    yiranw09
        49
    yiranw09  
    OP
       5h 54m ago
    @suke119 是增加 dflash 之后吗?并发效果如何?
    yiranw09
        50
    yiranw09  
    OP
       5h 53m ago
    @flyico 70w 大概率是超我们部门的预算了(
    提到集团公司上说不定有戏,这傻逼公司是真的抠门
    Haku
        51
    Haku  
       5h 47m ago via Android
    按百万算。
    不止你买硬件,后面跑起来电费,散热,维护也是一大笔开销。
    yiranw09
        52
    yiranw09  
    OP
       5h 46m ago
    @Jesens 上面的要求也太高了...哈,8 张 H100 ,我从哪偷啊
    dododada
        53
    dododada  
       5h 45m ago
    @Vveeb 理论内容如果是开放的,那值钱的除了商业机密,就是技术实施流程中的各种验证数据和验证方案了,这东西对生产制造行业来讲,就是命脉
    dododada
        54
    dododada  
       5h 43m ago
    好像 V 站的朋友很少和供应商打交道,渠道商肯定是缺货的,但是制造商不一定缺货啊
    yiranw09
        55
    yiranw09  
    OP
       5h 39m ago
    @dododada #54 到时候再拉上神通广大的商务,hhhh
    han1988
        56
    han1988  
       5h 27m ago
    最便宜是搞 4 张 cmp 170hx ,解锁到 40G 的就行。
    north521
        57
    north521  
       5h 21m ago
    两个 dgx spark 就行了,我这部署了,没问题,60 多 token/s
    bunai
        58
    bunai  
       5h 1m ago
    @north521 烫的起飞吧
    ZZFM
        59
    ZZFM  
       4h 30m ago
    用 MI300 或者 MI325 ,生产级别的硬件和代码,速度还够快,可以看看这个 https://github.com/ryanzhou/deepseek-v4-flash-mi300x
    cat9life
        60
    cat9life  
       4h 29m ago
    @north521 #57 两台总共 256G 显存不够的吧
    lrabbit
        61
    lrabbit  
       4h 13m ago
    @sky009 https://github.com/eugr/spark-vllm-docker/tree/main 吗,这个版本不会出现问题,跟官方的智商一模一样,我测试过了,其他版本可能会有点问题
    north521
        62
    north521  
       4h 13m ago
    @bunai #58 推理的时候七八十度
    north521
        63
    north521  
       4h 13m ago
    @cat9life #60 占了大概 220G
    beefhotpot
        64
    beefhotpot  
       3h 44m ago
    beefhotpot
        65
    beefhotpot  
       3h 44m ago
    #64, 八卡 5090 也能勉强跑,但是超级慢
    beefhotpot
        66
    beefhotpot  
       3h 43m ago
    syh2
        68
    syh2  
       2h 56m ago
    这种 284B 量级的模型,自己买设备,如果只走内存不走显存,貌似输出 token 特别慢,可能不一定能达到好用的要求
    superkkk
        69
    superkkk  
       16 mins ago
    8 卡或者 4 卡的 5090 能跑 fp8 或者 nvfp4 的,或者用 2 卡 pro6000
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3077 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 231ms · UTC 13:04 · PVG 21:04 · LAX 06:04 · JFK 09:04
    ♥ Do have faith in what you're doing.