想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程
想知道公司里部署一个可以供 20-40 人用的开源模型,需要大概怎样的硬件配置,一般会做文档处理,以及一些简单的编程
1
owen800q 15h 15m ago via iPhone
5090
|
4
Muze 14h 43m ago
可以搜 技术犬,他们好像专门弄这个静音 AI 机箱,但是价格动不动就 50 到 80 万的,看预算吧,有机房的话,可以去找各大服务器厂家询价,例如惠普,戴尔之类的
|
5
someonesnone 14h 41m ago via Android
感觉得魔改大显存
|
6
gpt5 14h 31m ago
看抖音上有人用 5000 块钱 diy 的丐版硬件部署 dsv4flash ,可以跑到 100tps 以上。
|
7
Integ 14h 25m ago via iPhone
4 张 RTX pro 6000 就够了。
|
8
wu67 14h 23m ago
除非数据有超常规格的保密要求, 不然还不如买套餐...本地跑单是商用电费就够你们喝一壶了
|
9
malusama 14h 22m ago
感觉现在本地部署根本不划算。。
|
11
woscaizi 14h 5m ago 现在 Agent 工具的上下文很大的,会导致 prefill 阶段很耗时。如果是 20-40 人使用绝对不是 4 张 5090 ,6000 就能搞定的
|
13
ttwxdly 13h 46m ago
少说 10 张 5090 。还有内存啥的,一点都不划算。
|
14
hrapunzel 13h 43m ago
deepseek-v4-flash 高精度量化模型,两个 dgx spark 可以跑
|
15
woscaizi 13h 42m ago
部署 deepseek 、glm 、mimimax 之类效果好的开源模型用起来会很好,但不是低成本就能部署下来的。你可以调研下部署 deepseek-v4-flash 需要多少钱,它的部署需求基本是最低的。如果是部署 qwen3.6-35B 级别,需要的资源少,但是任务成功的概率低。
|
16
beefhotpot 13h 26m ago
deepseek-v4-flash ,2 张 rtx pro 6000 可以跑。
|
17
zsj1029 13h 25m ago
h20 141 两张就够了 ds flash 很强,一步到位不要扣扣嗖嗖最后什么也搞不好
|
18
dcatfly 13h 17m ago
如果你本身比较了解模型相关的概念,可以参考 https://apxml.com/zh/tools/vram-calculator
如果本身不了解,可以直接拿你的需求问 chatgpt ,再结合上面的做参考 |
20
woscaizi 13h 13m ago
可以跑是一回事,能真的用起来是一回事。况且是 20-40 人使用
|
21
Inn0Vat10n 13h 12m ago
你要先说预算, 几十万,几百万,几千万,体验是完全不同的
|
22
darksword21 PRO 肯定 rtx pro 6000
|
23
94 12h 58m ago
之前收集过一段时间信息,总结时就是 50 万起步最低档,而且只是低可用的状态。所以最后是找阿里谈商务,保密的部分合同上面写清楚就是了。
|
24
wwhc 12h 56m ago
1 到 2 张 RTX 6000 + Qwen3.6/3.8 27B + llama.cpp 应该够你们公司用了,不建议用 vLLM ,推理速度可能快些,但输出质量不如 llama.cpp
|
25
edw1n 12h 47m ago
当前最具性价比的方案就是 2 台 NVIDIA DGX Spark 来部署 deepseek-v4-flash 。价格可以控制在 8 万以内,基本可以满足 20 人同时使用的性能。
|
26
allinQQQ 12h 26m ago
2 台 NVIDIA DGX Spark 部署 deepseek-v4-flash
GB10 性能比较差,双机基本只能 1~4 个并发 |
27
yanest 12h 26m ago via Android
我们这边有数据中心用的 5090 货源,8 卡,五十多万,最近又涨了一点。不过性价比很高,他们说的 pro6000 十万多一张没有性价比,如果模型能用 5090 跑起来是当前最优解
|
28
yanest 12h 25m ago via Android
五十多是整机
|
29
molvqingtai 12h 21m ago
GPT luna 不是免费了吗
|
30
restkhz 12h 20m ago
取决于预算。
勉强能跑起来交差的,五位数不到,跑个 Qwen3.6-35B-A3B 还是够的,文档处理,简单编程能做。不过搞好了没几个人想用。 5 位数算力带宽都好点的可以考虑比如还有几个小时就要发布的 Qwen3.8-27B ,能用。跑 Dense 要注意带宽。 好用点的,能长期用的准备差不多 6 位数了。准备将近 200G 的显存吧。 我这有用 H100+vLLM ,4K 上下文并发几十也没毛病。不过跑 Agent 上下文到 100K+明显卡 prefilling 。仅供参考。 |
31
enihcam 12h 14m ago
4 台 NVIDIA DGX Spark
|
32
VeteranCat 11h 57m ago
需要的显存至少按照 250G+准备,模型 v4 flash 就够用了,目前这个阶段的话是这样的。
如果跑 Qwen,Qwen3.5-122B 也差不多了,不会说胡话,能跑代码,能跑文档。 |
33
shmilypeter 11h 53m ago
如果只是十个人以内用的话还好,其实一台 Mac Studio 或者说 4 张 5090 就可以。但如果你要五十个人的并发,而且还要高级模型的话,至少得准备百万级别的预算,而且还要配备机房和专门的维护人员。
|
35
sankeff 10h 44m ago
这个我是真部署了,4 张魔改 4090 48G 的卡;
DeepSeek-V4-Flash 几乎只能一个人用。 稍微流畅点儿的用的 Qwen3.6-35B-A3B |
36
hisunny 10h 38m ago
给你个参考,4 块 V100 32G ,NVLINK 一代总线,用 lmdploy 跑 Qwen3.6-35b-a3b ,单线程能到 140 tps 。跑 Qwen3.6-27b 稠密,单线程能到 100+ tps 。整机 DGX-1,8 个 V100 ,当年(差不多 10 年前)卖 100 万。
|
37
ssiitotoo 10h 36m ago
可以租算力,我们公司租了 A800 40G 8 卡 一年 14w
|
38
Mzs 10h 5m ago
正经 50 人用 平头哥芯片 16 卡私有化部署 glm5.2 400w 元 勉强能支撑
|
39
superkkk 9h 39m ago
5090 跑 27b 的 qwen dense 模型 nvfp4 量化,或者 2 卡 pro6000D 跑 deepseek v4 0731 nvfp4 的量化
|
40
tcper 9h 18m ago
用买硬件的钱充 codex 或者 claude ,用到公司倒闭都用不完
|
41
pkxutao 9h 1m ago
真有意思,这个帖子让我见识到,哪怕是程序员,也存在不认真看内容、只想按自己的想法回答的现象
|
42
wqhui 8h 59m ago
最近刚刷到别人计算了一下,除非高强度使用,不然本地部署比买贵几十倍,差不多 20 年回本
|
43
Lighfer 8h 43m ago
实际经验告诉你:4*5090 部署 Qwen3.6 27B NVFP4 够了,我们 vllm 部署并跑了两个月了。
我们部门 100 号人,实际在用这个模型的大概也就是三四十号人的规模,日常也就 4~6 个并发请求,缓存命中率最低 75%左右,有一段时间维持在 94%左右。 除了确实偶尔会卡顿一下(来了个大请求 prefill 占了资源),日常还是很流畅的,多数时候每个请求基本都能维持在 40~75 tok/s 。 当然,如果你们是要用来疯狂 vibe coding 那肯定就不行了,不过这个模型也达到可以随意 vibe coding 的能力。 放几条日志上来看看,不是瞎说(贴图太麻烦了直接贴文本): ``` (APIServer pid=1) INFO 08-14 07:32:44 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 6927.3 tokens/s, Avg generation throughput: 211.5 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.3%, Prefix cache hit rate: 75.5%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:32:44 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.77, Accepted throughput: 135.20 tokens/s, Drafted throughput: 152.80 tokens/s, Accepted: 1352 tokens, Drafted: 1528 tokens, Per-position acceptance rate: 0.931, 0.839, Avg Draft acceptance rate: 88.5% (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:32:54 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 3843.2 tokens/s, Avg generation throughput: 382.0 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:32:54 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.73, Accepted throughput: 241.65 tokens/s, Drafted throughput: 280.15 tokens/s, Accepted: 2417 tokens, Drafted: 2802 tokens, Per-position acceptance rate: 0.916, 0.809, Avg Draft acceptance rate: 86.3% (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found (APIServer pid=1) INFO: xxxxx - "HEAD / HTTP/1.1" 404 Not Found (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:33:04 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 1300.6 tokens/s, Avg generation throughput: 332.5 tokens/s, Running: 2 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.8%, Prefix cache hit rate: 75.7%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:33:04 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.75, Accepted throughput: 211.70 tokens/s, Drafted throughput: 242.61 tokens/s, Accepted: 2117 tokens, Drafted: 2426 tokens, Per-position acceptance rate: 0.913, 0.832, Avg Draft acceptance rate: 87.3% (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:33:14 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 4531.0 tokens/s, Avg generation throughput: 204.7 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.4%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:33:14 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.90, Accepted throughput: 134.06 tokens/s, Drafted throughput: 141.16 tokens/s, Accepted: 1341 tokens, Drafted: 1412 tokens, Per-position acceptance rate: 0.970, 0.929, Avg Draft acceptance rate: 95.0% (APIServer pid=1) INFO: xxxxx - "POST /v1/chat/completions HTTP/1.1" 200 OK (APIServer pid=1) INFO 08-14 07:33:24 [loggers.py:310] 2 Engines Aggregated: Avg prompt throughput: 10786.8 tokens/s, Avg generation throughput: 173.7 tokens/s, Running: 7 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.6%, Prefix cache hit rate: 75.6%, MM cache hit rate: 0.0% (APIServer pid=1) INFO 08-14 07:33:24 [metrics.py:120] SpecDecoding metrics: Mean acceptance length: 2.83, Accepted throughput: 111.99 tokens/s, Drafted throughput: 122.59 tokens/s, Accepted: 1120 tokens, Drafted: 1226 tokens, Per-position acceptance rate: 0.949, 0.878, Avg Draft acceptance rate: 91.4% ``` |
45
pingpp00 7h 38m ago
可以看看懒猫微服,他们有一个算力仓 128GB 内存,性能不知道咋样,你可以问问
|
47
Zhepro 3h 45m ago
现在最便宜的应该是 170hx,单张卡 64g 显存六千多块钱
|
49
shelken 3h 31m ago via iPhone
我只给一个建议,别用任何 4bit 量化的模型,我体验了很多模型 4bit 量化之后跟 8bit 完全没法比
|
52
Mogugugugu 1h 43m ago
本地部署不太熟,但是可以给你推荐一个路子,找找本地的算力中心,一般都是大数据局牵头,联通/电信之类的承建的算力中心,可以让你独占式使用的,他们提供部署运维等甚至可以直接给你专线或 VPN 直接拉到公司,你要是有自建机房的话,他们也能提供国产 GPU+部署等,一些省份可以给你补贴 80%的费用,里面最大的问题就是基本都是国产卡,部署 deepseek v4 flash 是没啥问题的,上次问的是 pro 还在适配。
|