V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  coefu  ›  全部回复第 7 页 / 共 62 页
回复总数  1237
1 ... 3  4  5  6  7  8  9  10  11  12 ... 62  
4 月 21 日
回复了 diudiuu 创建的主题 Local LLM 部署本地模型 token 输出万能公式
铁子最近最大的贡献,就是让我对 dgx spark 祛魅了,😂。

我还一直想攒钱买,但是一看这拉胯的表现,还是算了。
1 ,如果没成家,并且短暂的时间内,都不想成家。那就随心而造,只要不违法犯罪,对自己的健康负责。缺少鸡血的时候,推荐你看乔布斯在斯坦福的演讲。年轻就是试错找路,没有什么是一成不变的。

2 ,如果你成家了,或者想成家,那么就只能稳,苟,对家庭负责。在这个框架限度内,从工作中硬找点乐趣,来充实自己。

3 ,没有人能预测五年之后的事情,国家层面的工作计划都是 5 年一个阶段。不要 FOMO 热点,这是我的经验。
4 月 21 日
回复了 kekxv 创建的主题 OpenAI 关于“AI 思考”长度
速食吃多了,dy 看多了,既要快,又要好,还要准。可能吗?
4 月 21 日
回复了 elliszkn 创建的主题 程序员 关于科研 ai 作图
plantUML
4 月 17 日
回复了 kfpenn 创建的主题 职场话题 v2er 大佬们, offer 选择求助
一个十多年都没嗝屁的玩具厂,还是有点东西的,还能随时代做转变,如果是我,我会选择 A 。因为 A 会更看重你,这对能力的提升是有帮助的。如果你有心,后续是有更多思路去观察制造业。

在 B 里,随时可有可无,没有存在感,随时 fire 你。讲真,要么做量化,要么做融资,但是股票期货,我更多相信是量化,但是量化的 coder ,讲真,当前的 LLM coder 针对的就是这种。主体在境外的,如果受限各种 zc ,一旦波动,fire 一个 team 太正常。 你能在这里拓展金融业甚至量化的可能,比较低,都是螺丝钉。

年轻人,大小周是一个点,但是也不能太短视。
4 月 17 日
回复了 Myst 创建的主题 职场话题 现在还需要时时刻刻追求新技术吗?
我每天都在起来之后和睡前,关注新进展,无他,兴趣使然。

不要 FOMO 热点,这是我的经验。找自己喜欢的方向跟一下。
4 月 17 日
回复了 archxm 创建的主题 程序员 RAG 难以让人满意啊
RAG 有门槛的,要一些工程优化的手段。准不准的关键在 rerank 。 当然了,细节上肯定是有语义丢失的,要想更精准,还是要新东西支持。RAG 本身就是个过渡方案。一两年之后,还有没有人继续用都是个问题。

给你介绍几个路线,免得被说嘴炮了:
1 ,又多又准,又省资源的路线: https://github.com/EverMind-AI/MSA ,这个技术可以将知识放到内存,省显存方案

2 ,又快又准: https://github.com/mempalace/mempalace ,启动 token O(1) 级别的快,还能记的准。

1 ,难一点,2 ,简单一点。
@coefu #6 all, qwen3.6 35B A3B 开源了,打榜分数确实更强,我打我自己的脸。
4 月 16 日
回复了 sqshanyao 创建的主题 Local LLM 求可靠本地 vibe coding,有八卡的 L20 服务器
先试 llama.cpp 的 8 卡 tensor parallel 。反正一年前的 8 卡 TP 模式,是有点问题的,不知道修复没有。如果不行,就上 vllm 。
4 月 16 日
回复了 sqshanyao 创建的主题 Local LLM 求可靠本地 vibe coding,有八卡的 L20 服务器
unsloth/Qwen3.5-397B-A17B-GGUF, UD-Q6_K,327G,留 50G 跑 context ,看情况;如果 context 不够,就换 UD-Q4_K_XL ,245G ,留 130G 跑 context ,肯定够的。

IDE 用开源的 continue 即可。想完全 agent ,估计够呛,你自己得盯着。local 的能力肯定不如云端 api 的。
agent 这条路,本身就是跑不通的。理论决定了。

每次 agent 的成功率到不了 100%,N 步之后,就会降到低于 1%,完全失败。云端无非就是用巨量资源让这个 N 长到能覆盖每个人的任务。端侧的这个 N 因为资源的限制,比云端 api 要低几个数量级。

云端 api 的体验,在 local 本地,基本上就无法体验到,理论决定了。
@enihcam #36 A16 这种,配合 LatentMAS ,实际上是当前最佳方案了。同一张卡有 4 个 gpu ,可以跑 4 个 qwen3.5 9B Q8 ,合作的好的话,能力提升是指数级的。
4 月 14 日
回复了 RatioPattern 创建的主题 Local LLM 32B 本地 vibe coding 有能用的模型吗
要用好,需要很多绝招。比较难搞,但也并不是搞不成。

用多个 agent 并行,并且改造成隐式推理,用 LatentMAS 技术( https://arxiv.org/abs/2511.20639https://github.com/Gen-Verse/LatentMAS ),这个要改 模型的 transformer 架构,将 kvcache 流动起来,对显存也有挑战。 多个 agent 并行隐式推理,能保证速度,多个 agent 也能提升智能。

就算是 Qwen3.5-35B-A3B 的 BF16 ,也有 70GB 了,长 context 的 kvcache + LatentMAS 本身也要显存,估计单卡 128G ,可以搞。
@coefu #37 不过,mi50 夸张的 1.02T/s bandwidth + pcie 4.0 ,足够有吸引力了.
@enihcam #36 还有一个极致的 hack 128G 方案,只怕你技术不行。

amd mi50 32G * 4 。 最关键是,mi50 32G 因为其折腾的门槛,海鲜市场当前 950 一张,4 张 才一张 nvidia tesla v100 32G 的价格。

但是,复杂的 rocm 配置,和多卡 tensor parallel 的技术,有点门槛的。
@diudiuu #25 你们赚钱了没?
@enihcam #26 你搞到技术面,还是基本面?基本面,我有大招。远超市面上的技术。
@enihcam #22 dgx spark 纯属老黄恶心人的,喜欢搞一些非 HBM 的 消费级 gddrX 显存 搞成超算产品。

什么 A10 ,A16 ,就是 Ampere 核心 + gddrX 显存。 特别是 A16 这个奇葩,搞了 4 个 弱 Ampere 核心(只有 1280 个 cuda+40 个 tensor core )+ 16G gddr6 ,一张卡凑了 64G 。每个 Ampere 到 gddr6 有 200GB/s 的 bandwidth ,四个 core 片上走 pcie 直通,tensor parallel inference 能搞到 800GB/s 。
@diudiuu #27 dgx spark 这么拉,我还想攒钱买呢,一看到

Memory:128 GB LPDDR5x unified system memory, 256-bit interface, 4266 MHz, 273 GB/s bandwidth

JD 上面要 3.4w ,就给个这。

我发现一个神卡,Nvidia tesla A16.

spark 就这尿性了,mem bandwidth 决定了的,推理引擎也救不了。 还不如 amd mi250:

GPU Memory
Dedicated Memory Size
128 GB
Dedicated Memory Type
HBM2e
Memory Interface
8192-bit
Memory Clock
1.6 GHz
Peak Memory Bandwidth
3.2 TB/s
Memory ECC Support
Yes (Full-Chip)

看 mi250 这屌炸天的 3.2T mem bandwidth ,就算是 rocm 拉,也就是优化 rocm 的事情,现在 LLM coder 都能整 cuda ,难道不能整 rocm ?看好 amd ,yes !
@philobscur #20 你什么技术底色,符合我对你的认知定位。但凡你懂点 web 之外的东西,算我对你高看一眼。
1 ... 3  4  5  6  7  8  9  10  11  12 ... 62  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2748 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 30ms · UTC 04:42 · PVG 12:42 · LAX 21:42 · JFK 00:42
♥ Do have faith in what you're doing.