V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  coefu  ›  全部回复第 2 页 / 共 62 页
回复总数  1237
1  2  3  4  5  6  7  8  9  10 ... 62  
19 天前
回复了 shendaowu 创建的主题 程序员 哪些因素会导致人低估大语言模型?
大部分不是这个领域的人的 高估低估 都是外行的八卦。

领域的发展也不会因为外行的高估低估有什么改变,因为能做出改变的不是这些人。
20 天前
回复了 zf2187 创建的主题 职场话题 创业三个月,我进入了创业的倦怠期
“有时候你根本都不知道问题出在了哪里,你甚至都不知道自己是哪里做错了。”

“我们的产品的产品叫“连连 AI”,用 AI 帮你找人和自动沟通,适合程序员、创业者等群体之间进行连接。但也正是因为平台性产品的定位,我们需要很多很多的用户。”

有没有可能,你这个 idea 就没搞头?典中典,感动了自己就以为能感动别人。
21 天前
回复了 tracker647 创建的主题 职场话题 关于学 ROS 的一些疑问
如果只是打工的话,201x 年代,可能会有一些小作坊能接受。但是当前嘛,有技能的人多得是。你卖的是技能,那就只能一两千页的书,从头开始,每个点都摸出一定深度。

如果你是自己搞,无所谓了。讲真,具身智能这块,还真像宇树的老板说的那样,先开搞,需要用到什么再学。毕竟是工程类,一开始就搞 一两千页的书从头开始,是个人都受不了。

比如灵巧手,这种需要什么场地?淘宝丰俭由人。

ps:ROS 如果你都觉得难,那具身智能要参与进去,估计够呛。真正搞深入,还得看原典。鱼皮的教程和 csdn 坐一桌。
22 天前
回复了 NorthGod 创建的主题 Local LLM 多机异构显卡组合推理
1 ,我押的是**内网一堆随时会掉的杂牌消费卡(网吧场景)上,节点掉了服务不断**——层粒度冗余 + 故障转移 + 预测调度 + 计费 / SaaS 。这是 vLLM (要可靠同构)和 llama.cpp rpc (无容错无服务层)都不碰的问题。

这才是最难的。

2 ,诚如 fcten 所言,我之前也忽略了事情的意义。 既然是多机多卡分布式推理,那么起码也得是搞个 300B 以上的模型才有意义。也就是说在 1 里所描述的,很难像 llama.cpp /vllm/sglang 那样通用。你只能在几种特色模型做 定制。支持的模型多寡,和功能是否能通,性能优劣。只能做平衡取舍。你不可能做到支持所有的模型,又还能性能卓绝。

3 ,在功能上来说,推理就是训练的 once ,这不只 llm ,任何机器学习的模型就是这样。你说的那是 推理支持并发的性能问题。和 web 领域一样,是只要 10 个并发的 blog 和 10w 并发的门户网站的技术区分。

4 ,如果 1 的问题你不是 vibe coding ,我可能还有兴趣凑合一波,但是哥们儿看不了也不想细看 vibe coding 的这种 infra 代码。

@NorthGod
让东南亚的老板赏识你重用你。
24 天前
回复了 NorthGod 创建的主题 Local LLM 多机异构显卡组合推理
最后,我依然对这种 有雄心壮志并且肯动手的人 此致敬礼!
24 天前
回复了 NorthGod 创建的主题 Local LLM 多机异构显卡组合推理
再多说几句:

1 ,你的问题,如果是 vllm 支持的 gpu ,那么 kuberay+vllm 早就能搞定 多机多卡分布式推理。如果是 vllm 不支持的 gpu ,llama.cpp 的 rpc server 支持多机多卡的 pipeline 模式即 layer split 的推理。tensor parallelism 即 llama.cpp 的 row split 目前还不能 多机多卡。

2 ,实际的,你的框架当前能单机多卡跑 Gemma4 系列,qwen3.5 系列 了吗,这是两种不同 attention 的模型,如果能跑通,benchmark 对比 llama.cpp 如何?如果跑不通,连走都还不行,就不要谈跑了。

3 ,cc 能让你搞一点 web 前后端,app 之类的,就不要以为能搞定这个 推理方向上最难的问题。

4 ,上半年号称要搞定单卡推理超出 gmem 参数容量的 LLM 的那哥们儿的项目,为什么熄火了?
24 天前
回复了 NorthGod 创建的主题 Local LLM 多机异构显卡组合推理
@NorthGod 看你这个回复,估摸着还没摸到门槛。你搞清楚了 microgpt 的每一个过程了吗?能从 0 开始训练一个 LLM 吗?你搞不清楚这些,怎么搞推理?推理就是训练的 once 。况且当前的 attention 的演化,导致 kvcache 分了不同的路线,这些你都不搞透彻,怎么把整个 LLM 切成多份?不管是横切,还是竖切。

最最主要的是,当前的 attention 加入 rnn 这种循环网络的动态机制之后,类似于 mamba ,混合 attention 连 llama.cpp 当前都没有完全搞定,就不要说 切分之后通信了。

你有想法是好的,但是不能太多的想当然了。
24 天前
回复了 NorthGod 创建的主题 Local LLM 多机异构显卡组合推理
@NorthGod 你先看明白,单机的多卡推理先,然后才是多机多卡。然后搞明白,推理引擎最重要的是什么。

1 ,首先,你不可能再造一个 类 llama.cpp 的框架轮子了。为什么,每个 LLM 的架构都在演化,每次都要重新根据不同框架写架构算子,这一块,一个人不可能搞得定。上对 LLM 框架理论,下对 cuda/musa/rocm/vulkan... 。

2 ,单机多卡的通信,多几多卡的通信。在 pipeline / tensor parallelism / expert parallelism ,通信上的难度是不一样的。

3 ,以上的问题无法收敛,这也是为什么 llama.cpp 现在 多几多卡 也只有 rpc server 。
25 天前
回复了 NorthGod 创建的主题 Local LLM 多机异构显卡组合推理
《 hands-on llm serving and optimization 》 看完过这本书没?

看完了你再想一下,你这个项目的难点在哪里,你准备怎么解决这些点。
整个发展,最大的泡沫就是这次的 "tokens" ,围绕 "tokens" 的一切 被刺破的时候,又要再回到一个低谷。

直到 忆阻器真正量产 并配合 snn ,才能真正的撑起 改变世界的 AI 。
他们这波人里,我最欣赏 陈天奇,李沐,王树森。
牛逼,有钱
因为世界就是这么千姿百态,你只是其中一分子。大家都面临着各种问题。
6 月 22 日
回复了 saySilence 创建的主题 程序员 有没有办法给 code agent 提供知识库?
你这个问题是一个 很核心也很基本的问题。

1 ,♾️ context ,这是理想目标。不过理论上可能是达不到了,因为过去的 context 一旦存在压缩,就必然有信息损失,如果能找到一种 信息的无损压缩方法,就很嗨皮了。

2 ,知识 和 经验,又不同,大部分静态知识 可以 lora / TTT ,搞进基础模型参数里。但是经验 是在迭代更新的,要么像 git 那样显式的版本控制,要么 memory 。但是都存在一个基本问题, 什么时候 记,什么时候 取。当前,就我来看,你只能显式的声明,把你认为重要的要模型记住的东西 写入 memory ,下次让模型先从 memory 里读 相关的内容。因为既然做不到 ♾️ context ,在不同 context 之间,只能用这种显式的有状态来同步。
6 月 22 日
回复了 kisshere 创建的主题 程序员 现在 HF 上的风味代码模型实际体验如何?
我感觉 jackrong 就是个整花活儿的,他可能在疯狂实验 缝合,蒸馏 这些技术的极限。

缝合这种早期技术,没有走太远,就说明了还是少点什么的。至于蒸馏,辅助罢了。

再风味,也摆脱不了 基础模型本身 层数 和 宽度 带来的基本限制。
@BaiLinfeng deepseek 的意义在于,不在硅谷,也能搞的出和硅谷扳扳手腕的 LLM ,祛魅之前对硅谷的亦步亦趋。
6 月 22 日
回复了 jiezou 创建的主题 Local LLM 大模型小白推荐一下本地模型
@Shielber 起步是 96G ,你打错数字了。
6 月 17 日
回复了 mountainl 创建的主题 Local LLM 分享个自己在用的玩具
这个玩游戏很爽了。
glm5.1 Q8 模型大小 811G ,10 个人并发的 1M context kvcache ,算 Q4 压缩,一个人大概留 100G ,因为 agent 回反复读 context ,那么 10 个人就得 1T 。所以你要准备 2T 左右 gmem 的环境,目前能买到的 H20 单卡 96G ,起码准备 20 张,单机 8 卡,准备 3 台机器。

h20 96G. ebay 上目前大概 8w 一张,卡就要 160w ,算 40w 能搞到 3 台服务器,外加网络。200w 起步,还要自己搞环境,另外电费另算。
1  2  3  4  5  6  7  8  9  10 ... 62  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2748 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 25ms · UTC 04:42 · PVG 12:42 · LAX 21:42 · JFK 00:42
♥ Do have faith in what you're doing.