• 请不要在回答技术问题时复制粘贴 AI 生成的内容
yohjisakamoto
V2EX  ›  程序员

反思一下为什么我的开源项目没有做好

  •  
  •   yohjisakamoto · 6h 38m ago · 843 views
    其实这个事情最开始是 26 年开始有很多号称可以节省 80%-90%token 的项目出来了,比如 RTK, caveman, ponytail.他们都声称可以节约大量的 token ,而且短期获得了几万的 github 收藏。 我之前的创业项目是做面向 e-commerce 的 chatbog ,其实是和 Universal Commerce Protocol (UCP) 一摸一样的一个产品,也是因为 UCP 的发布我没有再继续做这个赛道。今年早些时候,我就想把我们之前搭建 e-commerce chatbot agent 的架构做成 sdk 。简单说这个架构的核心是通过状态机和执行序列把同样任务中 llm 的 provider call 的往返次数减少 80%来降低同样规模的 token 消耗。

    现在的问题是这样的,我很清楚为什么 RTK 这类工具在真正的长任务中是完全无效的。
    我 18 号发布的报告,和 jetbrain 20 号发布的报告基本是同样的观察结果,RTK caveman 这类节省 toekn 的插件在真实长任务中毫无作用:
    https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-savings/
    https://turaai.net/blog#token-saving-plugins-are-mostly-stupid-idea

    我很清楚如何真正做到长任务中 80%+ 的 token 消耗减少。但问题是我在推广我的开源项目中遇到了非常大的困难。我把主要问题总结为 3 点:

    大多数 coding agent 用户,不论是有系统编程技能培训或是没有的所有 vibe coder 其实对真正的 token 消耗的原理理解差异很大。一个系统的讲解具体流程,并且挑战认知的长文章会在这个充满 ai 写作和 vibe coding 写出来的无数可以号称减少 95%token 使用的插件的论坛中显得愚蠢和天然没有传播性。

    简单的才易传播,人不是理性动物,只会相信自己更容易理解的事务。这就是为什么所有社交媒体上错误归因的伪科学永远比讲数学原理的频道有更高的关注度。

    作者的傲慢。这其实是两个问题的结合,在一个相信科学测试方法和 eval 科学的作者眼中。没有 eval 和 benchmark 的软件工程是无意义的。但事实是可能是作者自己的傲慢和对 rtk 这类工具的鄙视甚至是嫉妒造成了他更不愿意用更有效的方式传播他的作品。

    如果大家有时间看到这,可以给我提一些意见,告诉我如何才能在尊重 eval 和 benchmark 严谨性的同时更好的推广我的产品。 我知道用 codex 或者 claude 写一个 coding agent 很简单,但我也相信,总会有人理解 benchmark 和 eval harness 的价值。

    https://github.com/Tura-AI/tura
    目前项目 16 号发布现在 400 多个星,只能算个小透明
    Supplement 1  ·  5h 56m ago
    (重新编辑)

    感谢楼上的反馈。原文是我直接写的,但表达确实比较仓促,很多中英文术语混在一起,读起来不够顺畅。下面重新整理一次,核心问题不变:如何在坚持评测严谨性的同时,更有效地传播一个开源项目。

    利益披露:我是 Tura 的维护者。这篇帖子不是以第三方身份评价自己的项目,而是希望就开源项目的传播方式和评测方法获得坦率的建议。

    从 2026 年初开始,RTK 、Caveman 和 Ponytail 等项目声称可以减少 80%~ 90% 的 Token 使用量。其中一些项目在很短的时间内获得了数万 GitHub Star 。

    我之前的创业项目在做电商聊天机器人。事实上,它和后来发布的 Universal Commerce Protocol ( UCP )几乎相同。UCP 发布后,我决定不再继续这个方向。

    今年年初,我开始把我们为电商聊天机器人 Agent 构建的架构改造成 SDK 。简单来说,它的核心思路是使用状态机和确定性的执行序列,在完成同一任务时,将与 LLM 服务商之间的往返次数减少约 80%,从而显著降低 Token 消耗。

    我非常清楚 RTK 之类的工具为什么在真正的长时间任务中不起作用。我在 7 月 18 日发布了一份报告,JetBrains 在 7 月 20 日发布的报告得出了基本相同的结论:RTK 和 Caveman 这类 Token 节省插件,在真实的长时间任务中几乎没有效果。

    - JetBrains 报告: https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-savings/
    - 我的报告及可复现方法: https://github.com/Tura-AI/tura/blob/main/docs/blog/token-saving-plugins-are-mostly-stupid-idea.md

    我也认为自己知道如何在长时间任务中真正实现超过 80% 的 Token 降低。然而,我发现宣传这个开源项目比构建它困难得多。

    ## 我认为问题出在哪里

    ### 大多数编程 Agent 用户并不关心是什么真正导致了 Token 消耗

    无论是接受过正式软件工程训练的开发者,还是自学的“氛围编程者”,编程 Agent 用户之间都存在巨大的认知差距。

    一篇系统解释运行机制、并挑战既有假设的长文章,在已经充斥着 AI 生成文章和“节省 95% Token”插件的论坛里,很难得到传播。

    简单的观点更容易传播。人并非完全理性,通常更愿意相信容易理解的解释。这或许也是为什么建立在错误因果关系上的伪科学内容,往往比认真解释数学原理的内容获得更多关注。

    ### 作者本人的傲慢

    这可能是两个问题的结合。

    对于一个非常相信科学测试、评测和基准测试的人来说,没有评测支持的软件工程主张可能毫无意义。

    但也许正是我自己的傲慢,以及我对 RTK 等工具的轻视,甚至嫉妒,让我不愿意用真正有效的方式介绍和推广自己的工作。

    如果你读到了这里,我真诚地希望得到你的建议:

    - 如何在不牺牲严格评测和基准测试的前提下,更有效地介绍这个项目?
    - 什么样的证据会让你愿意尝试一个不知名的编程 Agent SDK ?
    - 目前的表达是否过于技术化、过于攻击性,或者选错了目标受众?
    - 我应该如何修改仓库首页或基准测试的展示方式?

    我知道,使用 Codex 或 Claude 构建一个编程 Agent 并不算特别困难。但我也相信,总会有人理解基准测试和评测框架的价值。

    项目于 7 月 16 日发布,目前有 400 多个 GitHub Star:

    https://github.com/Tura-AI/tura

    欢迎批评,包括你不会使用它的原因。
    9 replies    2026-07-26 00:23:02 +08:00
    fructose
        1
    fructose  
       6h 16m ago   ❤️ 1
    这些文字读起来很难受,可能是因为你的母语不是中文,同时没有使用好的翻译工具。
    This text is difficult to read, perhaps because Chinese isn’t your native language and you didn’t use a good translation tool.
    yohjisakamoto
        2
    yohjisakamoto  
    OP
       6h 6m ago
    @fructose ...哥们我是中文写的不至于吧
    gullitintanni
        3
    gullitintanni  
       5h 58m ago
    @fructose #1 有可能是 AI 写的或者润色过的。AI 特别擅长这种语法正确但是读起来难受的长难句。

    母语非中文的作者如果能写成这样,那和母语也差不多了。甚至已经超出中文互联网的平均水平了。
    yohjisakamoto
        4
    yohjisakamoto  
    OP
       5h 55m ago
    @gullitintanni ..不是 20 岁才出国国内读了高中为啥就变成了非中文母语者了
    duuu
        5
    duuu  
       5h 23m ago
    确实是看起来有点难受,其实没有 AI 味,说不出来什么原因
    Googlefan
        6
    Googlefan  
       5h 19m ago via Android
    阅读起来,有一种看机器翻译的感觉
    yohjisakamoto
        7
    yohjisakamoto  
    OP
       5h 13m ago
    @duuu 我问了我室友她说是因为句子太多从句了,像英文不断加从句。
    Deshun
        8
    Deshun  
       4h 44m ago
    声称、早些时候,这些词汇,在我看来就是直接机翻,不可能是中国人写出来的。
    lesismal
        9
    lesismal  
       2h 36m ago
    看不懂,但已 Star 。

    其实专业领域的人面对非专业领域的人在阐述问题时带有较多术语,并且经过良好训练的人讲求逻辑严谨、带很多定语或从句之类的,导致句子复杂,跟考研英语、雅思学术之类的长难句一个道理。
    然后就显得难于理解,不接地气了。这属于正常现象,习惯了学习/学院/学术方式严谨思维的人,想改变到面向市场的思维方式挺难的。这是另一种“聪明反被聪明误”。

    祝 OP 成功!
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1025 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 42ms · UTC 18:59 · PVG 02:59 · LAX 11:59 · JFK 14:59
    ♥ Do have faith in what you're doing.