V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  sillydaddy  ›  全部回复第 10 页 / 共 162 页
回复总数  3229
1 ... 6  7  8  9  10  11  12  13  14  15 ... 162  
如果是**检索信息**而不是**全量处理文档**,有没有可能改进一下流程?即,不要把所有的内容,都作为输入 token ,这样太消耗了!可以使用工具+ReACT 模式,去递进的搜索、提取。

这是我在做的项目,试了下,相比之前,感觉能把成本减少 90%以上: /t/1215475
是不是算错了?我算着应该是几万块钱。

「缓存率看了一下 10%左右」,再加上「输入输出是 20:1 」这相当于 500 亿 token 几乎都是输入 token 了!就算按 mimo-v2.5 或者 deepseek v4 flash 的低价( 1 块/百万 token ),也是 50000 个「百万 token 」,即 5 万块钱!不是你说的几千块。更何况用 pro 版还要加几倍。
6 月 5 日
回复了 timqian 创建的主题 分享创造 Lean4.js
有点好奇 OP 准备把这个用在哪儿。程序员好像对这个都不感冒。
6 月 2 日
回复了 ixixi 创建的主题 Vibe Coding 需要这样一个功能
做好了,可以售卖,保证火!就像那只特制的,只有“Accept/Reject”2 个按键的键盘一样。
6 月 2 日
回复了 NASK 创建的主题 Cursor 用 cursor 的不要再用 HTTP/1.0 或者 HTTP/1.1 协议了
这到底是 bug 还是 feature ,搞不懂了。我最近把代理客户端从 shadowsocks 换成了可以开 tun 模式(虚拟网卡模式)的 clash ,终于可以用上 Opus 4.8 了。属于是被逼着学习新东西了,不过 Clash 确实好用。
有点意思啊,我前不久才了解到有 Remotion ,我还以为它只是做成品视频的。
我还纳闷说怎么没看到你说的视频,原来还可以用 web player 这样做,而且里面的文本都可以选中。
学习了。感谢 OP 分享。
主要是不好换算。没有一个合适的基准。我觉得一个比较好的基准是,未缓存输入 token 与 credit 的交换比例,接近 1:1 。

cached input: 1000 万
non-cached input:20 万
output:5 万

这样非常容易在 token 和花费之间估算,上面的都折算成 non-cached input:1000 万/50 + 20 万 + 5 万*2 = 50 万。对于 DeepSeek V4 Flash ,就是 0.5 元。
5 月 28 日
回复了 HHHans 创建的主题 问与答 AI 编程是否是一种无效内卷?
内卷是说效率低,把大量时间或资源,耗费在很小的提升上,比如农业上的精耕细作,比如为了竞争分数而鸡娃学习和考试那些不必要的东西。为这些东西的大量付出带来的价值微乎其微。

AI 编程是这样吗?感觉这 2 个不搭边啊。个人或者公司消耗 token ,肯定是为了带来价值,比如节省开发时间或精力,这些省下来的当然是价值。也一定会产生对应的后果,比如总财富增加,总劳动时间减少。换句话说,如果没有带来任何改变,你为什么要用 AI 编程呢?假如你说是为了不落后于同事,那好,假如你们公司所有人都是因为竞争压力而采用 AI 编程,那这种竞争带来了什么呢?公司的生产效率有没有提高?公司的产出有没有增加?增加了的话,社会总财富就会增加,那么要么工资增加,要么就是工资不变但购买力增加了。你说的「时间和钱也没变多」,是不符合常理的。
@TuTouPower 反正雷死人不偿命。。实际是现在区分了缓存 input 和未缓存 input ,但大众哪懂这个,直接简单粗暴 2 亿->110 亿,7 亿->380 亿,多直接!等你把中转站挂出去,回过味来,你也不能骂他,因为它用量确实比以前多了几倍。厉害吧。
又一个被小米套路到的😓,不是一千亿 token ,是一千亿 credits 。每个 token 现在消耗几百个 credits 了。
@sillydaddy #4 上面的例子算错了😓,10 轮命中率=550000/650000=85%。
一般用 claude code 这类 agent ,缓存会占比很大,一般都会在 90%以上。因为它要经历 thinking..action..thinking..action 这样很多轮,轮次越多,缓存占比越大,因为每一轮都会把之前轮的那些输入喂给大模型,这些就是缓存。

假如每轮新输入 10000 个 token ,那么 10 轮后,未缓存的就是 100000 个 token ,缓存的呢? 10000+20000+30000+...+100000=5550000 ,缓存命中率=5550000/5650000=98%

实际要考虑上下文超出会压缩,导致原来的缓存失效。但缓存命中率只跟 Agent 工具的用法有关系,Agent 模式一般都能到 90%以上,除非你特意优化 Agent 的流程,减少缓存的占用,比如使用定制的流程去处理,例如那些 AI 视频生成管线,把流程前一环节的输出经过筛选,作为下一环节 API 调用的输入,而不是堆积信息,这样会减少缓存。

这是我用 claude code 调用小米 token plan 处理文本提取信息,这个场景下的消耗(缓存占比非常大,命中率 97%,这种情况下,可用量确实提高了 10 倍左右):
https://v2ex.com/t/1215750#r_17686925

不过,小米套路多倒是真的。
@LittleTree 可能是国内国外的不匹配?我的 token plan 是走的新加坡。
谢谢 OP ,麻烦填我的吧,早知道调价这么低,就不那么早用完了。邀请码:A2ZFD2 。注册: https://platform.xiaomimimo.com?ref=A2ZFD2 (注册后点控制台左下方入口填入,体验金 40 天有效)

小米套路真多:先 0 元赠送,再趁剩 3~4 天时,重置额度,让人感激。再趁热乎把价格调到和 DeepSeek 一样。还有 7 亿->380 亿 credits 的营销噱头,你直接把缓存 token 的价格调降到 0.02credit 不就行了吗。
5 月 27 日
回复了 aes114514gcm 创建的主题 小米 Mimo Token Plan 重置额度,并大幅提升配额
确实是 5~8 倍的提升!看图:
https://i.v2ex.co/yOG9s3dCl.jpeg

token plan 的话,使用 mimo-v2.5 ,把现在的 380 亿,除以 100Credits/token ,想当于原来的 3.8 亿 Credits 。

未缓存输入 = 640 万
+ 缓存输入折合 = 200 万( 22436 万/120 倍)
+ 输出折合 = 140 万( 73 万*2 倍)
-----
总消耗 = 1000 万,占 3.8 亿 token 的 1/38 。

而按旧方式,上图的 2.3 亿 credits ,占了赠送的 7 亿 token 的 1/3 。
等于用量提升了 12 倍(当然,我的缓存命中率比较高,占 97% 。但一般 Agent 使用场景,缓存输入都是占大头。)
5 月 26 日
回复了 sillydaddy 创建的主题 数据库 向量数据库的正确用法是什么?
@icew23 #26 而且,即使是建立了结构化信息,仍然要使用 ReACT 模式。比如我提到的标签网络,搜索一个句子,可以转化成搜索多个标签,通过搜索多个标签,找到这些标签关联节点集合,然后对它们取交并差,问题在于,每个标签所关联到的节点集合,都是非常多的,就像向量搜索时匹配到的句段一样。这就让最后的筛选结果,仍然面临 topK 类似的困境。需要由 AI 来 ReACT ,决定是否继续筛选,是否要调整筛选条件。
5 月 26 日
回复了 sillydaddy 创建的主题 数据库 向量数据库的正确用法是什么?
@icew23 #26 感觉有达成共识了,对于知识库这种,用向量数据库+结构化信息。结构化信息需要 AI 跑一遍来提取。我在那篇笔记标签网络的主题里面,就是在手动建标签网络,现在有了 AI ,跑一遍就可以把标签网络建立起来了。你觉得那篇的想法怎么样?对于这个主题里搜集信息这种一次性的,AI 驱动的 ReACT 模式,应该比较省成本,不用考虑无关的内容。
5 月 26 日
回复了 sillydaddy 创建的主题 数据库 向量数据库的正确用法是什么?
@PiersSoCool #17 我算了一下,DeepSeek V4 Flash ,百万输入 token 是 1 块钱,我单单 govmap 这个项目就要花费三千块左右。
5 月 26 日
回复了 sillydaddy 创建的主题 数据库 向量数据库的正确用法是什么?
@Morriaty 太感谢了!看样子最优解就是这个了。我把它作为附言吧,标记为已解决。

这样 token 数量应该是比较少的,配合 DeepSeek 的低缓存价格,完全足够了,token 数量基本取决于未缓存的输入 token ,而这些 token 基本就是那些包含有效信息的文字量,最多增加一个常数倍。

而且这种方式,应该就是向量数据库的最优解了:因为向量数据库只是给出一种渐进的匹配度。不存在机械式的程序可以客观判定的分割线,所以,最终的截止需要由人类来决定,或者由类似于人类理解力的 LLM 来决定。你说的 ReACT 模式,渐进式,恰恰符合这个模式。
1 ... 6  7  8  9  10  11  12  13  14  15 ... 162  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2864 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 33ms · UTC 10:07 · PVG 18:07 · LAX 03:07 · JFK 06:07
♥ Do have faith in what you're doing.