V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  coefu  ›  全部回复第 8 页 / 共 62 页
回复总数  1237
1 ... 4  5  6  7  8  9  10  11  12  13 ... 62  
@xing7673 阿里都要闭源卖 api 了,还指望开源能替代它自己 api 的东西?都成立了 Token 顶级组织,明摆着要让你们围绕各种 app 消费 tokens ,真是井底之蛙,夏虫语冰。
@philobscur #10 不要看说什么,等放出来了再来打我脸,ok ?真放出来,确实强,那是我这次错了。
@MuyuQ #11 因为从 2024 年春天开始,这两年来我几乎每个开源模型的中小尺寸都尝试过。


我主要集中在神经网络底层前沿技术的探索能力。Transformer 的变种实验,SNN 脉冲神经网络的变种实验,DRL 里自定义网络实验。我提供 idea ,模型给代码,我跑结果,模型 debug ,这个 loop 。在线的官方模型 和 本地部署的 中小尺寸,比照能力。

有一讲一,我去年夏天用 qwen 在线的模型,一起 debug DRL ,几度把我带到了坑里。

后面换 chatgpt ,效果好一点,但是胡说八道依然存在,给出的论文索引大部分都是假的。

后面用 gemini ,就在上上周,我用 gemini ,再不知情的情况下,我们(我提供 idea ,gemini 负责代码实现)从 0 复现了 snn 里程碑的论文( https://www.frontiersin.org/journals/computational-neuroscience/articles/10.3389/fncom.2015.00099/full )。就这感觉,qwen/chatgpt 从来没有给我带来过。在 qwen3.5 开源的同时,我就本地用了一个下午,强确实强,但那是 gemma4 没开源的时候。昨天我用了 gemma4 一下午,对比在线 gemini ,同样的问题,几乎能给出 90%相似度的解决方案。你说,我激不激动? gemini 的能力,我是深度认可的,因为在一些还没有结论的问题上,确实能辅助一起探索,关键是几乎不胡说八道。

最后,如果只是一些 web 前后端代码 coding ,讲真,那只是很中规中矩的使用,感受不到上限的提升。
@unt 我觉得,和 gemini 来比,gemini 现在搞的这种情绪价值提供,反而让人不客观了。今天,试用了一下午 gemma4 31B,可能是 system prompt 没有设置什么情绪相关,反而更理性客观,没有 gemini 的夸夸味。
@unt 当前开源里,普罗大众能用到的最强悍模型了。2* 2080ti 22g ,不到 4k 的成本,跑 31B Q8 ,估计能有个 10 Token/s 的速度,凑合能用。
@philobscur qwen3.5 就是阿里开源的最后绝唱了,你还等什么 3.6 咯,事情都搞不明白。
非常强悍,g 厂出手,都是弟弟。

31B ,要真正跑起 256k 的 context ,Q8 起码要 64G 显存。

对于一般 web 代码来说,体现不出来它的上限。当然,一般人也用不到它的上限。

现在打榜的 benchmark ,都是对标 博士级别的水平,只有你的 case 是真正的挑战,才知道和别的差距。
@tftNExtLife #14 你在你自己的世界里,玩耍的开心就行。不用再回复了。
@tftNExtLife #10 要是你这个真落实到实际生活中了,才可怕。以后你接了哪些项目,先发上来,让哥们儿知晓一下。

那篇文章太长了,我认为你肯定没有仔细完整的看完过。中心思想是 壳是过渡状态,LLM 本身能力的提升 会让 harness 这个壳 一直变化,一直迭代堵 LLM 的能力短板。至于 多 agent ,就和社会化治理一样多样化,甚至很难决出个第一。所以,你说你的 多 agent 方案,怎么样怎么样,讲句实话,就和 腾讯和阿里他们讲公司治理一样。这不是什么技术层面的事情。

什么是“涌现”,你先搞清楚了,再用这个词。
少点自己想当然的 YY ,多看点业界别人搞过的论文。

https://mp.weixin.qq.com/s/DE0hc3Mz6zwoSCgL0k4SgQ
4 月 3 日
回复了 Livid 创建的主题 Google Gemma 4 可以通过洗车测试
@dacapoday nvidia dgx spark ,只是有钱没钱的区别。
https://mp.weixin.qq.com/s/DE0hc3Mz6zwoSCgL0k4SgQ

这哥们儿写了一篇正当时。

你们可以看到 订阅的 tokens 都是怎么烧没的,😄。以及,当前大众上下文语境中的“AI”的边界在哪里,这个问题可以衍生的,在 coding 领域如此,openclaw 所延伸的领域亦是如此。当最熟悉的 coding 领域都如此难搞,别的开放离散场景,只会更加难搞。
和 80 年代的 专家模型,本质上是一个路数的;如果你读过 The Bitter Lesson, 就能明白,这种把人类先验知识注入的模式,终究就是走不通的。
3 月 30 日
回复了 0o0o0o0 创建的主题 V2EX V2EX 是否在实质上接受了 AI 生成的内容了
要都是那种 LLM 生成的文本,过不了多久,就没人乐意上号发言了。就彻底完犊子了。
没有什么是不变的,都是变化的。没有什么金饭碗,银饭碗。

LLM 的架构和能力一直再提升。

比如 RAG 这种外围工程, 就有一个新的 MSA 架构,可以在 LLM 的 网络架构上重新设计一个模块,性能和功能都比 RAG 这种外围工程要好,以后做 RAG 的就会渐渐消失。

比如 长程记忆,现在也是做外围工程,但是 当 Test-Time Training 这种范式,渐渐成熟之后,性能和功能都优于基于外围框架的 长程记忆,也会渐渐消失。

也就可能 agentic 这块,还能有点存在价值,但是也是越做越少。

现在的情况是,做外围工程的信息比 LLM 原生的进展 慢,有信息差,实际上当 LLM 的原生能力提升之后,会吞噬它周边的一些当前过渡阶段的工程实现。
3 月 27 日
回复了 weishao666 创建的主题 Local LLM 本地部署 deepseek 70B,回答乱码
qwen3.5 4B 8 bit 都比 deepseek 70B 要强。
3 月 27 日
回复了 weishao666 创建的主题 Local LLM 本地部署 deepseek 70B,回答乱码
@gigishy 不用量化版本,有那么多资源?而且,量化技术,实际上损耗很低了。unsloth 的动态量化 8bit 可以达到 95%+ FP16 的效果。

OP 这个问题,主要是:
1 ,deepseek 70B,已经很落后了。
2 ,OP 的问题,知识库里没有,还要联网搜索。

不过,我看情况猜,大概率是用的 没有动态量化的普通量化版本,而且还是类似于 2~4bit 之间的。
1 ... 4  5  6  7  8  9  10  11  12  13 ... 62  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2748 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 87ms · UTC 04:42 · PVG 12:42 · LAX 21:42 · JFK 00:42
♥ Do have faith in what you're doing.