V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  coefu  ›  全部回复第 4 页 / 共 62 页
回复总数  1237
1  2  3  4  5  6  7  8  9  10 ... 62  
6 月 11 日
回复了 Livid 创建的主题 Local LLM DiffusionGemma
Diffusion 这条路,依然没有解决当前 LLM prefill 里 超长 context 说带来的 attention O(n²) 消耗。只是在 token generator 上做了加速的文章。但是当前 agent 模式的瓶颈,已经不在 token generator 。

解决 prefill 的 attention O(n²) ,依然任重道远。 主要是信息论里,对 过去 context 的压缩 是否能保证完全无损,这是当前很长时间内的根本矛盾。
6 月 11 日
回复了 Livid 创建的主题 Local LLM DiffusionGemma
@BingoXuan Gemma4 31B 擅长的是 stem 的理论逻辑。coding 确实不如 qwen3.6 27B 。
6 月 11 日
回复了 Livid 创建的主题 Local LLM DiffusionGemma
@BingoXuan
@kennylam777

qwen3.6 27B 是真正的能打,我现在日常主力了。能感觉到,这个模型之后,这个板块沉寂了很长一段时间,恐怕大家都是偷着乐的。


27B 真正能打,是因为它在 27B 这样的参数下,能搞到惊人的 64 层 dense ,模型的宽和深,有个奇妙的组合甜点位。只顾宽不顾深,就只有广博知识面,但是缺乏逻辑深度和缜密,只知道夸夸其谈,经不起推敲。只有深度,没有宽度就是个诡辩的杠精。但是 27B 兼顾了知识面的广度和逻辑的深度,但是如果再增参数和深度,本地部署又失去了可能。巨大的参数所产生的 kvcache ,以及 agent 模式下 context 的反复进出,单卡带宽完全跟不上,就算是 gmem/umem 的容量够,attention 的 O(n²) 也是无解的。

可能是绝唱,也可能是当下开源的极限。
6 月 11 日
回复了 Livid 创建的主题 Local LLM DiffusionGemma
qwen 这次估计要落后 Gemma 团队了,Gemma 总能整出一些新活儿。😂
这个方向的东西都是一抓一大把了,你这个和同类竞品有什么优势?你只提到了解决你遇到的问题,还是感动自己了一位就能感动别人的典中典。
6 月 10 日
回复了 Demon7z 创建的主题 程序员 不懂就问-AI 开发
因为大部分使用 vibe coding 的 application ,对于这个世界来说,没有什么意义。无所谓的,都是乐色。还是他们自己 LLM 产生的,有什么所谓的隐私?
6 月 10 日
回复了 cunganbu0521 创建的主题 程序员 有技术大牛吗
问题都问不明白,为什么要教你?
6 月 10 日
回复了 yuping913 创建的主题 Local LLM Gemma4 12b 居然比 Qwen3.5 9b 还快,意料不到
因为 gemma4 12B 有 48 层,qwen3.5 9B 只有 32 层。层深度决定了逻辑的缜密性。
@zzutmebwd 根本性的解决方案是 pp 过程,怎么保持 O(n)的算法。要是能找到个方案,那真的是非常嗨皮了。
6 月 9 日
回复了 mingtdlb 创建的主题 Local LLM 现在大模型主流都用哪些 nVidia GPU?
要是能买到,amd 的 mi 系列,可能会更好点。
还得和 context 长度挂钩,越长越线性下降。
6 月 9 日
回复了 davidyin 创建的主题 Local LLM 想折腾一个 AI 主机,请行家出手
@zzutmebwd 只要模型能力足够强,pp 慢了点,但是能搞定,我也能接受的,任务布置下去,让它哼哧哼哧的搞。
6 月 9 日
回复了 TGOcc 创建的主题 Local LLM Mac book air M5 32G+1TB 能跑本地大模型?
内存不够的情况下,最新的 qat 量化版本,确实有得搞。Q4 的体积,Q8 的效果。
6 月 9 日
回复了 TGOcc 创建的主题 Local LLM Mac book air M5 32G+1TB 能跑本地大模型?
@TGOcc m5 max 的统一内存带宽才 614GB/s ,真正对推理影响最大的还是内存带宽,apple metal gpu 核心,讲真,最终在 263k 的 context ,完全没有影响了。我的 m1 ultra ,qwen27B Q8 在 150k context 之后,tg 就下滑到了 5 左右。但是大部分情况下,最终还是能完成任务的,这还是因为 qwen 27B 的 Q8 确实强。
6 月 9 日
回复了 TGOcc 创建的主题 Local LLM Mac book air M5 32G+1TB 能跑本地大模型?
另外,oMLX 最大的问题是 让 context 无法往 263k 去,因为一旦 内存过了告警阈值,就直接 panic 了。

所以,我推荐 llama.cpp ,不要信那些说什么不用 oMLX 就浪费 apple metal gpu 的,他们压根儿就没实践过。我用 llama.cpp 直接把 gpu 利用率搞到了 100%。

llama.cpp 能把 context 搞到 263k ,并且 Q4 量化,能把内存逼近到极限,但是不会 panic 。
6 月 8 日
回复了 TGOcc 创建的主题 Local LLM Mac book air M5 32G+1TB 能跑本地大模型?
mac 系列真正能打的是,ultra ,128G 内存就是甜点位。因为 800GB 的内存带宽,模型超过 60G ,在 long context 的情况下,pp 过程慢的让人怀疑人生。96G 内存是最舒服了,263k context 可以跑 Q8.
6 月 6 日
回复了 followadc 创建的主题 Local LLM mac 64g 能部署哪个本地大模型
@followadc 我换了 moe 模型,并且用 llama.cpp 把 context 搞到了 263k 。总体来说,还是可以的。
6 月 5 日
回复了 followadc 创建的主题 Local LLM mac 64g 能部署哪个本地大模型
即便是 ultra ,dense 模型,在 263k 的 context 下,pp 依然会降到 100 一下,比较闹心。
6 月 5 日
回复了 CatCode 创建的主题 Local LLM Gemma4 12B 如何跑在 16G 显存上?
这个 12B 昨天刚出,我就测了,16G 太尴尬了,context 完全跑不起来。起码要 32G ,多出来的 20G 跑 context 。
6 月 5 日
回复了 kakalulin 创建的主题 Local LLM mac mini 跑本地模型,需要什么配置?
mac mini 的内存带宽,会慢的让你怀疑人生。
1  2  3  4  5  6  7  8  9  10 ... 62  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2748 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 23ms · UTC 04:42 · PVG 12:42 · LAX 21:42 · JFK 00:42
♥ Do have faith in what you're doing.