langsfang's recent timeline updates
langsfang

langsfang

V2EX member #178311, joined on 2016-06-20 22:34:53 +08:00
langsfang's recent replies
1. 更便宜的是 grep/rg ,当前没有一个 coding agent 用 embedding 就是这个原因
2. 我的方案 2KB per token ,是比 embedding 大,但我觉得 index size 不是问题,recall/precision 才是
3. 没有用 rope 外推的方案实现 10M 的 search
稍微偏题一下,我是觉得用 embedding 来做检索像是走了岔路,这都是在 LLM 不成熟的时候发展起来的
很早之前,我就发现 LLM 能做 in-context learning ,其实本质上就是在 context 内做检索,那 attention 能否直接来做检索呢?
所以我试了一下,用 qwen-3.5 的 0.8B/2B/4B/9B 模型,直接把文本做 KV, 来了 query 后用 attention 来做检索,效果很好,LoCoMo 和 LongMemEval 的测试都是 SOTA ,在代码搜索上,也在一个 semble benchmark 上 SOTA 了,对 10M context 上搜索效果也很好( qwen 3.5 原生 256K context ),并且用 swe-qa benchmark 做了测试,有了搜索后,在 CC 上 token 使用量下降 50%左右
当然代价就是空间和性能,其实主要是 index,也就是生成 KV 的时间较长,search 其实还好,不需要 decode,只需要在原始 KV 上 prefill 一下 query 就行,有 GPU 加速很快
有没有 benchmark, 能够证明这种方法的优势呢?
@verrickt AI 认为 AOE 是前期的一个关键能力,所以都会拿一两张 AOE 的卡
@Faintlike 研究了一下 Neuro-sama ,看来还是需要一个公司来运营,不适合独立开发者
另外想到,以后会不会有很多 agent 打游戏的直播?
@acx4040110 工具很多,StS1 里用得最多的就是 https://github.com/ForgottenArbiter/CommunicationMod 直接把游戏状态导出为 json, StS2 里也有很多现成的 MCP,github 上一搜就有
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5875 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 12ms · UTC 02:18 · PVG 10:18 · LAX 19:18 · JFK 22:18
♥ Do have faith in what you're doing.