restkhz's recent timeline updates
restkhz
ONLINE

restkhz

V2EX member #435565, joined on 2019-08-13 09:09:56 +08:00
Today's activity rank 2861
restkhz's recent replies
2h 15m ago
Replied to a topic by linora 生活 关于减肚子,大家有什么好的经验
@FaustinaD 能做到的是真厉害,狠人。
不算相关专业,个人认为不可能会无限扩大。下面的几个说辞也只是臆测,论坛灌水,不太经得起推敲。

1. 人类知识有限。绝大多数知识其实只是已有知识的更进一步。其中关系才是玄妙的地方。如果说可以归纳法得出的知识其实体积可能并没多大。至于某厂 API 调用方式其实完全可以利用互联网检索或者 RAG ,增长速度有限。
2. 贵在推理方式和经验,这几乎就是智能本身。然而这种东西占用多少空间?我不知道。但是应该不会是线性增长的。
3. Qwen3.6 27B 仅有 27B 的参数量,智能接近 Nemotron 3 Ultra 550B A55B ,MiMo-V2.5 这个 310B ,A15B.(根据 artificialanalysis )
4. Qwen3.6 27B 有如此智能不是没有代价的。它为了一个回答会进行大量的推理,以时间换空间。我曾经用过 Qwen3.5-9B 的模型,在某些,比如化学问题上一些刁钻的具体的化合物它完全没训练过,不知道是什么,但是只是根据一些规则就推理了出来。但是光推理就消耗了大量 tokens.令我惊讶的是,这个 9B 模型居然推理出了正确答案。者可以说明小 dense 或者 MoE 激活参数实际上增长不会快,未来多数场景完全够用。
5. 如果只是单纯说知识量,不如搞个搜索引擎,然后爬下/录入全人类的数据了。但是数据库没有智能。

我有一个暴论,在未来,随着算力和存储的提升,人们会在模型知识量和推理耗时,智能,以及他们的成本,用户场景体验中找到产品的平衡点。意味着实际上模型体积不会无限(至少不可能是线性)增大。未来大多数问题可能一个足够优秀的小模型+搜索/RAG 就能够解决。或者,可能会有缓慢增大(非线性增长)的 MoE+搜索/RAG,但是激活参数不会涨很快。

我认同 @ryd994 的观点。
鉴于最近的一些网络安全事件,大概可以理解。

其实从一开始就一直在讨论 AI 安全问题,当时他们还搞了个伦理与安全委员会,OpenAI 成立当初也是为了不能让这种技术掌握在少数人手里,只不过最后都变质了。

我也不觉得这种呼吁和限制中国模型发展有多大关系,毕竟算力已经卡的够死了。如果真是为了限制,还不如这三家联合搞点新闻跳个脚,让美国政府继续对中国施压。呼吁?真的有用吗?

Mythos 和最近 hf 的事情先不说真假,去年的 opus-4 已经能独立解出一个 VM opcode 混淆逆向的 CTF 题目。
我这本地跑一个 Qwen3.6-27B 它也晓得用 nmap,用 nuclei ,一路字典爆破顺便搞搞漏洞 exp.初级 CTF 逆向题和 pwn 它也完全能做到,能逆向分析恶意软件并且给函数重命名辅助逆向。我完全相信比它大百倍的模型有更恐怖的能力。

搞不好今年年底就有哪个中国公司开放权重一个百来 b 参数,能力接近 Mythos 的模型,还被人 abliterated ,直接武器化...
比如 GPT 早些时候经常说:
(最)能打
(不是)银弹,(而是)
实际落盘
Jun 24
Replied to a topic by lei2015 问与答 付费寻求关闭道德约束的 ai
Venice 。他们有 Gemma4 和 Qwen 的一些无审查模型,还有一个应该是 Dolphin 系列的。不记得了。有些是他们自己运行的模型,也有一些应该是提示词越狱的。

还有一个 nanogpt ,有 GLM-4.6 和 Qwen3.5 27B 去审查的,我有在用,但是他们家不是特别稳定。有时候感觉他们模型加载会失败。比如这会 GLM-4.6 无审查就 timeout 。有点玄学。

这两家都提供 API.

注意这些链接里我加了推广,你可以选择是否支持我一下(搓手)

https://venice.ai/chat?ref=B3nl-J
https://nano-gpt.com/r/xb6cpkrR
好巧不巧,我当时还真玩过那个盘古 Aplha ,当时叫鹏程盘古α。时间久远记忆模糊,我不评价。

但是我想说几个事实:
2019 的 GPT-2 可能不够大,但是已经能装模做样写东西了。Reddit 上还有人做 GPT-2 bot
GPT-3 是 2020 年的,最大 175B 的尺寸。
盘古 Alpha 是 2021 年的东西,最大 200B.
21 年同一年 Google 出了一个叫 LaMDA 的玩意儿,也是一百多 B 参数。当时还有个颇有争议的新闻。
22 年年底,GPT-3.5 发布。

嗯...?
去 civitai 看看吧。
May 19
Replied to a topic by jony83 随想 对于目前的关于 ai 的看法和感受
不谈论 AI,但是什么叫“只要是人造的都能被量化”,“意识不能被量化”?
那么,艺术,诗歌的好坏,作为人造概念,如果你认为思维不可量化,作为意识延伸的他们可以被量化吗?

上面部分我在试图制造悖论反驳,和下面内容无关。

思维意识真的不可以量化吗?
你举的反例并非证明了思维不可量化,而是不可能得到完全准确未来的信息。
你讲的更像是如果我们制造了精准预测石头剪刀布的机器,那么两个机器互相作为对手将会陷入死机。但是这和思维,意识能否量化无关。我们哪怕接受了拉普拉斯妖的存在,假设海森堡不确定性原理不存在,我们能精确测量出每一个量子的状态,给某个时刻做一个完全精确的快照,也不可能精确推测整个环境的未来:
因为这个环境里已经有了一个能预测未来的机器,而这个机器运行必将套娃式模拟它自己,这需要无穷大的算力。所以我们不能精确预测未来,打破混沌。如果你只是部分模拟,剔除这个机器,那么必将因为误差,精度随时间快速下降。

这也是为什么我们要“模型”。虽然做不到 100%正确,但哪怕只是比抛硬币好一点都会有用。

我认为你的逻辑有误,你是怎么从“不可能算命”,“若能量化,人一生就决定了就算知道结果再怎么努力也无法改变”得到“所以思维意识是不可被量化的”?
“思维”和“人生被决定”完全是两个系统,两个环境。你不能因为我们没法预测未来或者有三体问题就得到结论:天体运行不可预测,牛顿开普勒他们都是错的。


这堵墙的存在和人的思维意识无关,人脑只不过是个生化计算机,架构和实现不同而已。


况且,一定只有生物的思维,才叫思维,一定只有生物的意识,才叫意识吗?
May 10
Replied to a topic by davidyin Local LLM 想折腾一个 AI 主机,请行家出手
@davidyin 我不专业,但是有些经验你可以参考:

12G 显存太小了,完全完全地不推荐。小的模型完全能跑,甚至跑挺快,但模型本身太小鸡肋无用,能做点事的模型至少 30B 左右。哪怕 Q4 了你 12G 也跑不动。我有一个 3060 ,12G 显存,算力带宽都没问题但是生产力相关的基本什么都跑不了。

另外 UMA 带宽小的要谨慎。比如 AI MAX 395 ,我有一台,请谨慎考虑。用 Qwen3.6 35B 那些 MoE 模型倒是挺好,密集模型速度很慢,比如 Qwen3.6 27B ,不错的模型,但是跑推理大概 10t/s 不到,非常缓慢。不知道未来上 MTP 或者投机解码会不会有一点改善,最近 llama.cpp 有但是貌似还没进主线。另外在 395 上 Q4,Q5 的 Qwen3.5 122B 倒也不是不能跑,但是经常让我觉得不如高精度的 Qwen3.6 35B 。

还有 AI MAX 395 跑 ComfyUI 那些扩散模型玩 AIGC 也不快,能跑是都能跑,就是太慢。跑 LTX-2.3 生成 5 秒视频用了 15 分钟。这机器内存大很多东西都能跑,但问题是很多东西跑不快...

精度也很重要,我不觉得 Q4 量化真的好用。能跑归能跑,但是回答模棱两可,幻觉多,不建议用于生产。为了生产有条件建议 Q6 起步。

说到底还是建议直接 VRAM 直接 32G 起步吧。首先关注 VRAM,其次关注带宽。24G 可以是 ComfyUI 玩得舒服,但是你要跑编码我真不建议。
如果没这个预算建议买 API,剩下钱理财。说不定还能再赚点,过一年再看看模型能力提高,硬件会不会降价。不然你的钱就是打水漂的。

我只是踩过坑,请你千万不要对 20G 以下 VRAM 抱有任何不切实际的幻想。甚至我上文提到的那些模型生产力在 claude, gemini 和 chatGPT 面前也不是一个档次的。只是说,它具备这个能力罢了。
我是之前有搞信息安全上的需要,我不得不用 abliterated 模型才搞的...
楼上很多 v2 貌似不知道什么是 ASIC...
这家不是在做计算芯片,而是简单粗暴的把模型权重全写到一个芯片里。比起来搞什么计算核心,取指令,做计算,访存,流水线,分支预测那一套,这玩意直接按位连线就行。要加 0 芯片上直接连线,要加 1 就取反,加法器都省了。乘偶数直接靠位移就好。又快又省电。

目前权重太多铺不下,但是工艺和布线如果还能优化,塞个大点的模型,4bit 量化,很有前景啊。
如果一个芯片不够大,那就搞多个芯片,之间数据交换做好,应该能快速跑更大更精良的模型。

如果这个搞起来了,可能对 Nvidia 不会是好消息。训练还是 Nvidia,可能跑模型的机房就不需要那么多 GPU 了。以后 AI 竞争可能更多会跑到模型那里。
Token 价格可以进一步被打下去。

楼上骂的都是 Llama 3.1 8B 在 3bit 量化下的表现,和这个技术无关。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   926 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 13ms · UTC 21:22 · PVG 05:22 · LAX 14:22 · JFK 17:22
♥ Do have faith in what you're doing.